Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
4855 connectés 

 


Quel titre pour notre topic ?


 
27.0 %
 10 votes
1.  Infra IA : aide au choix et troubleshot de LLM Locaux
 
 
8.1 %
 3 votes
2.  Infra IA : le topic qui reveil vos GPUs
 
 
13.5 %
 5 votes
3.  IA Locale : llama.cpp, VLLM, modèles, tuning! For science. You monster.
 
 
10.8 %
 4 votes
4.  IA Locale : dresseurs de vRAM, LLM, CUDA, RocM, MLX Llama.cpp de père en fils
 
 
10.8 %
 4 votes
5.  IA Locale : votre IA selon vos termes ! (sous condition de ressources en vRAM)
 
 
5.4 %
 2 votes
6.  IA Locale : vous aussi venez mesurer votre pouvoir d'achat en HBM / GDDR / LPDDR / DDR / SDRam / EDO ...
 
 
13.5 %
 5 votes
7.  IA Locale : aucun GPU ni LLM n'a été maltraité pour cette inférence
 
 
8.1 %
 3 votes
8.  IA Locale : joignez l'inférence au chauffage de votre domicile !
 
 
2.7 %
    1 vote
9.  IA Locale : la generation generative au bercail
 

Total : 39 votes (2 votes blancs)
Sondage à 8 choix possibles.
Ce sondage est clos, vous ne pouvez plus voter
 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  34  35  36  37  38  39
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°45032
Quich
Pouet ?
Posté le 13-08-2026 à 16:11:36  profilanswer
 

Reprise du message précédent :

neo world a écrit :

Je pense que ça va prendre de la valeur encore. Si tu jettes un coup d’œil sur eBay tu as régulièrement du matos de serveur / workstation avec genre la moitié des banques mémoire de populées. C’est pas aussi efficient que les serveurs format cpu de laptop mais si t’as besoin de RAM tu as déjà un gros morceau du problème :jap:


Oui mais ce n'est pas assez gros.
Au mieux tu montes à 8 barrettes par CPU, ça fait que 32GB avec des barrettes 4GB.
Et le plus gros cpu en ddr3 (excepté 2-3 modèles exotiques en v3/v4 pour lesquels c'est compliqué de trouver une carte mère) c'est l'e5-2697v2, 12c/24t en Ivy-bridge, pas d'AVX2 et du PCI-e 3.0 max.


---------------
Feedback
n°45033
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 13-08-2026 à 16:14:14  profilanswer
 

C'est pour ca que j'ai pris des barrettes en 32gb  [:sharliecheen:3]


---------------
Victime de girafophobie, mais se soigne.
n°45034
the_fennec
f3nn3cUs z3rd4
Posté le 13-08-2026 à 16:15:04  profilanswer
 

De DDR3?
 
edit: ça doit être ça qu'on avait sur les servers a 192GB de RAM
 [:grandvampire]


Message édité par the_fennec le 13-08-2026 à 16:16:07

---------------
Faudra que je teste un jour :o
n°45036
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 13-08-2026 à 16:22:14  profilanswer
 

Oui en ddr3, tu trouve encore dans les 80e les lot de 128gb en lrdimm


---------------
Victime de girafophobie, mais se soigne.
n°45040
neo world
Posté le 13-08-2026 à 17:11:21  profilanswer
 

faut taper dans le bisocket (assez fréquent en workstation et pléthorique en rackable) ou si tu veux vraiment y aller all in t'as des quad socket avec des cartes d'extension de RAM. Les plus gros (Dell R920 ou équivalent chez HP / IBM / Bull) prennent 96 barettes d'un coup. Il t'en manque au final :o
 
Ou plus exotique encore les cartes PCI express de NVRAM (vraiment utile si tu as un truc qui fait beaucoup d'ecriture au point d'épuiser la flash. Attention faut une batterie de secours et des backups :D


Message édité par neo world le 13-08-2026 à 17:19:31
n°45043
croustx
Modoadorateur
Posté le 13-08-2026 à 18:46:50  profilanswer
 

Vous essayez vraiment de faire tourner en LLM en DDR3 ? :o

n°45046
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 13-08-2026 à 18:53:53  profilanswer
 

Chacun fait comme il peut [:galom]


---------------
Victime de girafophobie, mais se soigne.
n°45060
M300A
Posté le 13-08-2026 à 20:24:43  profilanswer
 

:hello:

 

Ca m'amuse maintenant vos conneries et je me tâte à upgrader ma machine. J'ai un Ryzen 16cores, les tout premier et je pense upgrade à 4x 32Gb de DDR4 et plus tard choper un gpu sympa (si un jour les rtx6k redescendent sur terre).

 

Je peux faire tourner quelque chose quand même avec ça ou ça sert a rien ? Les 128G de ddr4 c'est pas du tout cadeau donc si c'est inutile je vais pas dépenser pour rien :)


---------------
:wq
n°45067
the_fennec
f3nn3cUs z3rd4
Posté le 13-08-2026 à 21:18:22  profilanswer
 

Non, en CPU pure aucun intérêt, surtout un modèle a 100Go.
 
T'as combien actuellement? Si c'est genre 32Go, tu peux essayer un ik_llama avec Qwen 35B Q4_K_M pour voir.


---------------
Faudra que je teste un jour :o
n°45068
neo world
Posté le 13-08-2026 à 21:21:51  profilanswer
 

M300A a écrit :

:hello:
 
Ca m'amuse maintenant vos conneries et je me tâte à upgrader ma machine. J'ai un Ryzen 16cores, les tout premier et je pense upgrade à 4x 32Gb de DDR4 et plus tard choper un gpu sympa (si un jour les rtx6k redescendent sur terre).
 
Je peux faire tourner quelque chose quand même avec ça ou ça sert a rien ? Les 128G de ddr4 c'est pas du tout cadeau donc si c'est inutile je vais pas dépenser pour rien :)


vu le monstre que tu as au travail à ta place je ne mettrai pas trop de sous là dedans si c'est que pour de l'IA : plus facile de couper la prod un weekend ou autre pour faire des essais :jap:
 
Éventuellement achète un AMD AI Strix Halo ou mieux un Nvidia Spark ou encore mieux un Apple M5 Max : tu as 128GB utilisables dans de bonnes conditions et tu attends encore 5 ans pour que le marché secondaire soit inondé de H100 ou de 6000 pro à vile prix :jap:
 
Probablement une bonne idée de t'équiper maintenant si tu en as le besoin. Plus les modèles locaux seront efficaces plus ce sera difficile de t'équiper à prix correct pour encore quelques bonnes années :/

n°45088
LaRoueEstT​ombee
Hortense ! Pour moi !
Posté le 14-08-2026 à 00:31:10  profilanswer
 

Quich a écrit :


J'ai approximativement ça en DDR3 REG ECC :
60x 4096 MB PC3-10600R CAS 9 Samsung M393B5273CH0-CH9  
4x 4096 MB PC3-8500R CAS 7 Nanya NT4GC72B4NA1NL-BE  
4x 4096 MB PC3-8500R CAS 7 Elpida EBJ41HE4BAFA-AE-E  
12x 4096 MB PC3-10600R CAS 9 Nanya NT4GC72B8PB0NL-GC  
2x 4096 MB PC3-8500R CAS 7 Hynix HMT151R7BFR4C  
1x 4096 MB PC3L-10600R CAS 9 Micron MT18KSF51272PDZ-1G4M1HE  

 

Et peut-être une ou deux 8GB, je ne sais plus. Le reste en 16GB et 8GB sont dans les deux machines mentionnées avant.


:jap: Je regarde la semaine prochaine à mon retour.

 

Et ce n'est pas pour faire tourner des modèles, j'ai un vieux gen8 sur lequel je fais tourner quelques services qui consomment un peu de RAM :pt1cable: C'est ouf, les deux Xeon pas tout récents tiennent le coup, par contre ça swap à mort par moment.


---------------
Votre couroux impitoiable Veut-il renverser l'Univers ?
n°45090
Pipould's
Posté le 14-08-2026 à 00:51:21  profilanswer
 

moyen_moins a écrit :


ah ?
tu peux en dire plus ? :)


Assez simple, sur de longues sessions il est assez rapide pour être une alternative a du SaaS...

n°45092
neo world
Posté le 14-08-2026 à 01:24:11  profilanswer
 

J'ai testé de mon côté unsloth/muse-glimmer-30b Q4_K_XL
 
Très bon sur la partie recherche web / idéation. Je ferais des tests comme chef d’orchestre à côté de Qwen 3.x sur mon Strix Halo en remplacement de GLM 5.1

n°45093
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 14-08-2026 à 02:28:28  profilanswer
 

Il se débrouille tres bien avec les appels outils, dans mes workflows technique il s'en sort mieux que gemma ou qwen 3.6 27b  
Par contre pour le reste je lui prefere le 3.6.
J'ai hâte d'etre demain pour le 3.8 :D


---------------
Victime de girafophobie, mais se soigne.
n°45101
the_fennec
f3nn3cUs z3rd4
Posté le 14-08-2026 à 08:27:08  profilanswer
 

Qwen 3.8 2.4T 1bit IQ1_S 508GB
https://huggingface.co/unsloth/Qwen3.8-2.4T-A95B-GGUF
 
https://www.reddit.com/r/LocalLLaMA [...] _s_medium/
 
C'est dingue que ça marche encore et que ça donne des résultats a ce niveau!


---------------
Faudra que je teste un jour :o
n°45125
yohaskan
Posté le 14-08-2026 à 11:49:55  profilanswer
 

Pendant ce temps chez Unsloth...
https://i.gifer.com/S2AH.gif


Message édité par yohaskan le 14-08-2026 à 11:53:57
n°45127
the_fennec
f3nn3cUs z3rd4
Posté le 14-08-2026 à 12:18:38  profilanswer
 

La carte de 27B est la:
https://huggingface.co/Qwen/Qwen3.8-27B
 
faut scroller un peu
 

Citation :


Qwen3.8-27B features the following enhancements:
 
    Core Capabilities: Comprehensive improvements across coding, professional work, research, and long-horizon agentic tasks.
    Agent Execution: Stronger autonomous planning and better handling of environment feedback, leading to more reliable end-to-end task completion.
    Downstream Compatibility: Broader support for popular harnesses and development tools, making it easier to integrate into your existing stack.
    Flexible Thinking Control: Thinking mode is on by default and can be disabled per request; reasoning depth can be tuned with reasoning_effort, and reasoning context from historical messages is retained via preserve_thinking.
    Vision-Language Understanding: Native support for image and video understanding, from STEM diagrams and documents to hour-scale videos.
 
 
 
Qwen3.8 comes with official support for reasoning_effort, which can be used to adjust reasoning depth and control cost:
 
    xhigh (default): for complex tasks demanding thorough analysis
    medium: balancing accuracy and speed
    low: efficient reasoning optimizing for speed and cost
 
In addition, preserve_thinking is enabled by default for all workloads for the best out-of-the-box experience. To disable preserved thinking, refer to the examples here.

Message cité 1 fois
Message édité par the_fennec le 14-08-2026 à 12:35:11

---------------
Faudra que je teste un jour :o
n°45135
yohaskan
Posté le 14-08-2026 à 13:30:13  profilanswer
 

the_fennec a écrit :

La carte de 27B est la:
https://huggingface.co/Qwen/Qwen3.8-27B
 
faut scroller un peu
 

Citation :


Qwen3.8-27B features the following enhancements:
 
    Core Capabilities: Comprehensive improvements across coding, professional work, research, and long-horizon agentic tasks.
    Agent Execution: Stronger autonomous planning and better handling of environment feedback, leading to more reliable end-to-end task completion.
    Downstream Compatibility: Broader support for popular harnesses and development tools, making it easier to integrate into your existing stack.
    Flexible Thinking Control: Thinking mode is on by default and can be disabled per request; reasoning depth can be tuned with reasoning_effort, and reasoning context from historical messages is retained via preserve_thinking.
    Vision-Language Understanding: Native support for image and video understanding, from STEM diagrams and documents to hour-scale videos.
 
 
 
Qwen3.8 comes with official support for reasoning_effort, which can be used to adjust reasoning depth and control cost:
 
    xhigh (default): for complex tasks demanding thorough analysis
    medium: balancing accuracy and speed
    low: efficient reasoning optimizing for speed and cost
 
In addition, preserve_thinking is enabled by default for all workloads for the best out-of-the-box experience. To disable preserved thinking, refer to the examples here.



 
Ah interessant,
"To disable preserved thinking, refer to the examples here."
+ "low: efficient reasoning optimizing for speed and cost"

 
Sans raisonnement/think, les réponse simples arrivent en 0.3s au lieu de 3s en moyenne.
Et ce temps de gagné, c'est avoir la réponse en quasi temps réel ; il ne reste plus que le temps de géneration du chunk audio qui prend elle aussi 2 à 3s TTFA ( time to first audio)
Guère plus qu'une conversation où un humain reflechirait un temps aussi avant de repondre  

n°45139
Pipould's
Posté le 14-08-2026 à 14:19:14  profilanswer
 

Putain mais le prix des NVIDIA CMP 170HX part deja en sucette... 1500 balles !
 
https://www.ebay.de/sch/i.html?_nkw [...] m570.l1313
 

n°45141
neo world
Posté le 14-08-2026 à 14:30:20  profilanswer
 

prenez des bosgame pc à ce prix : y'a une garantie et des maj au moins :D

n°45142
Pipould's
Posté le 14-08-2026 à 14:34:12  profilanswer
 

neo world a écrit :

prenez des bosgame pc à ce prix : y'a une garantie et des maj au moins :D


 
J'ai deja un strix et franchement j'hesite a le revendre...

n°45143
neo world
Posté le 14-08-2026 à 14:56:44  profilanswer
 

pour le remplacer par plus adapté ou pas besoin finalement ?

n°45145
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 14-08-2026 à 15:14:45  profilanswer
 

J' étais bien chaud aussi pour un 395+ 128gb, mais au final je trouve que c'est un peu batard : pas de NVIDIA donc pour image/vidéo c'est un peu la mort.
Énormément de vram... Ou pas : finalement avoir 24gb ça suffit pour les tops petit modèles, et 128 reste trop peu pour les gros vraiment intéressant.

 

De ce fait je pense simplement partir sur un server avec 24/32gb de vram et ce sera largement suffisant.

 

Après je peut me tromper,mais c'est mon ressenti


---------------
Victime de girafophobie, mais se soigne.
n°45146
ibuprophet
Posté le 14-08-2026 à 15:19:38  profilanswer
 

C'est également mon ressenti. En ce moment c'est soit qwen 27B, soit 128Go de RAM/VRAM ça n'est pas suffisant, il faudrait à minima le double pour avoir un modèle avec un vrai gap au-dessus du qwen 27B en openweight.

n°45147
neo world
Posté le 14-08-2026 à 15:27:22  profilanswer
 

je pense que tu as raison. Hors cas d'usage où tu veux pouvoir tourner en temps réel sur quelques modèles (spe planification / tool / architecture + un spe codeur + documentation par exemple)
 
ou c'est bien pour expérimenter du colibri à quasi 2 tokens / secondes au lieu de 0.5. Ce qui ne change pas grand chose.
 
Par contre ça prend de la valeur depuis son achat. C'est un bon asset :o :o :o
 

n°45148
pop_pop
System.NoBeerException
Posté le 14-08-2026 à 15:30:07  profilanswer
 

Encore une heure à patienter  :whistle:  https://huggingface.co/Qwen/Qwen3.8-27B

n°45149
the_fennec
f3nn3cUs z3rd4
Posté le 14-08-2026 à 16:24:25  profilanswer
 

Pipould's a écrit :

Putain mais le prix des NVIDIA CMP 170HX part deja en sucette... 1500 balles !
 
https://www.ebay.de/sch/i.html?_nkw [...] m570.l1313
 


 
J'ai consulté des vendeurs qui affichaient encore des prix descends, moins de 200 euros, juste après avoir vu pour le unlock, ils m'ont tous fais des devis a 1200, ça fait un moment que c'est partis en sucette. Je pense que vu le peu de retours, ce sont des data centers qui doivent tout chopper ...


---------------
Faudra que je teste un jour :o
n°45150
the_fennec
f3nn3cUs z3rd4
Posté le 14-08-2026 à 16:25:51  profilanswer
 

Pareil pour les 395+ 128gb, je me dis que les gros modèles n'ont pas une vitesse suffisante, donc on doit rester sur du Qwen 27B/35B...


---------------
Faudra que je teste un jour :o
n°45151
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 14-08-2026 à 16:44:21  profilanswer
 

J'ai aussi eu des retour du revendeurs chez qui ont voulais en acheter : l'unlock est pas aussi fiable que prévus apparemment. Il a eu pas mal de retours de gens mécontent qui voulais spécialement les gpu pour cet usage et qui se révèlent pas stable avec :O


---------------
Victime de girafophobie, mais se soigne.
n°45152
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 14-08-2026 à 16:46:34  profilanswer
 

the_fennec a écrit :

Pareil pour les 395+ 128gb, je me dis que les gros modèles n'ont pas une vitesse suffisante, donc on doit rester sur du Qwen 27B/35B...


 
Disons que c'est une taille de ram un peu batarde : trop gros pour les petits models, trop petit pour les gros models. Le top ce serais une version 256 voir 512 pour justifier l'achat  :sweat:


---------------
Victime de girafophobie, mais se soigne.
n°45153
the_fennec
f3nn3cUs z3rd4
Posté le 14-08-2026 à 16:54:29  profilanswer
 

Tronklou a écrit :

J'ai aussi eu des retour du revendeurs chez qui ont voulais en acheter : l'unlock est pas aussi fiable que prévus apparemment. Il a eu pas mal de retours de gens mécontent qui voulais spécialement les gpu pour cet usage et qui se révèlent pas stable avec :O


 
Quelle surprise, on se demande bien pourquoi NVidia a convertis ces A100 en 170hx :o
 

Tronklou a écrit :


 
Disons que c'est une taille de ram un peu batarde : trop gros pour les petits models, trop petit pour les gros models. Le top ce serais une version 256 voir 512 pour justifier l'achat  :sweat:


 
Est-ce que le GPU a assez de puissance pour faire tourner un DS4 seul?
Genre c'est un peu comme si on avait des 3060 avec 64GB de VRAM....


---------------
Faudra que je teste un jour :o
n°45154
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 14-08-2026 à 17:01:03  profilanswer
 

Plutôt des 6800 avec beaucoup de vram de ce que je lis, en gros avec nos bc250 ont as une config dans le même esprit avec les mêmes limites du fait d'avoir du amd et pas du nvidia.
 
Pipould's et neo world devraient pouvoir mieux en parler vus qu'ils en ont :D
 
Edit : ayé dispo https://huggingface.co/unsloth/Qwen3.8-27B-GGUF
 
Edit 2 : les servers sont en PLS  :pt1cable:

Message cité 1 fois
Message édité par Tronklou le 14-08-2026 à 17:18:02

---------------
Victime de girafophobie, mais se soigne.
n°45155
Pipould's
Posté le 14-08-2026 à 17:15:41  profilanswer
 

the_fennec a écrit :


 
Est-ce que le GPU a assez de puissance pour faire tourner un DS4 seul?
Genre c'est un peu comme si on avait des 3060 avec 64GB de VRAM....


 
Ben en utilisant la ram t'as ds4, qwen 3.5 122b, qwen 3 next coder...  
 
Sinon pour de mulitples modeles charges en //
 
Mais pour de l'agentique simple, go 48GB avec qwen 27b et basta

n°45156
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 14-08-2026 à 17:17:29  profilanswer
 

En // c'est plutot chargé et dispo ? Car sinon a chaque fois tu divise encore les tok/s de sortie drastiquement non ?


---------------
Victime de girafophobie, mais se soigne.
n°45160
MisterMoT
Les loutres vainqueront
Posté le 14-08-2026 à 17:38:32  profilanswer
 

[:kb208:3]
Salut, je me suis mis a faire de la génération d'images récemment avec Stability Matrix. (C'est le seul truc que j'arrive à faire tourner avec ma CG) Et bien entendu LMstudio, qui me permet de faire un peu de powershell mais aussi traiter des gros pdf de contrats / administratif.
Mon matos:
9850x3D
32 Go
RX6950XT
Nvme 2T
Win 11 dédié à ça (Dual boot avec Bazzite pour le gaming) j'ai essayé avec Linux mais impossible de faire fonctionner la CG :o
Au plaisir d'échanger :jap:


---------------
Labellisé Original HB Seal Of Quality :o
n°45161
neo world
Posté le 14-08-2026 à 17:45:53  profilanswer
 

Welcome ! tu arrives pile pour le nouveau Qwen :D

n°45174
the_fennec
f3nn3cUs z3rd4
Posté le 14-08-2026 à 18:52:20  profilanswer
 

Pipould's a écrit :


 
Ben en utilisant la ram t'as ds4, qwen 3.5 122b, qwen 3 next coder...  
 
Sinon pour de mulitples modeles charges en //
 
Mais pour de l'agentique simple, go 48GB avec qwen 27b et basta


 
T'as quoi comme pp/tgs avec DS4?
Qwen 122B et Coder Next sont des vieux tromblons, 27B est au dessus, peut être même 35B.


---------------
Faudra que je teste un jour :o
n°45178
the_fennec
f3nn3cUs z3rd4
Posté le 14-08-2026 à 18:57:38  profilanswer
 

Tronklou a écrit :

Plutôt des 6800 avec beaucoup de vram de ce que je lis, en gros avec nos bc250 ont as une config dans le même esprit avec les mêmes limites du fait d'avoir du amd et pas du nvidia.
 
Pipould's et neo world devraient pouvoir mieux en parler vus qu'ils en ont :D
 
Edit : ayé dispo https://huggingface.co/unsloth/Qwen3.8-27B-GGUF
 
Edit 2 : les servers sont en PLS  :pt1cable:


 
DL en cours, 50Mo/s ça va.
 
Bordel le truc est devant Opus 4.6 sur certains benchs:
https://i.imgur.com/Af9Mnqb.png


Message édité par the_fennec le 14-08-2026 à 18:58:06

---------------
Faudra que je teste un jour :o
n°45180
MisterMoT
Les loutres vainqueront
Posté le 14-08-2026 à 19:13:07  profilanswer
 

neo world a écrit :

Welcome ! tu arrives pile pour le nouveau Qwen :D


Merci je vais tester ça ce souwar :D


---------------
Labellisé Original HB Seal Of Quality :o
n°45181
moyen_moin​s
chat réincarné
Posté le 14-08-2026 à 20:16:34  profilanswer
 

Pour le qwen 27b, vous partez sur quelle quantization ? :o
J'ai déjà eu des fails sur des trucs assez simples en q4 auparavant, en général je suis sur du q5 ud xl min en général pour avoir ce que je veux.
Bon, ça vient peut être de la qualité de mes prompts aussi :whistle:

n°45182
the_fennec
f3nn3cUs z3rd4
Posté le 14-08-2026 à 20:21:42  profilanswer
 

Qwen3.8-27B-UD-Q8_K_XL avec MTP de base, 4GB de moins que 3.6
 
https://progressive-gale-c3jf.pagedrop.io
 
13 tg/s 5min de génération  :love:  
 
 
pour rappel:

the_fennec a écrit :


 
Qwen3.6-27B UD-Q8_K_XL_MTP
 
https://nebular-tree-329n.pagedrop.io
 
11 tg/s et 11min de génération.


---------------
Faudra que je teste un jour :o
 Page :   1  2  3  4  5  ..  34  35  36  37  38  39

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)