| |||||
| Auteur | Sujet : Infra IA : aide au choix et troubleshot de LLM Locaux |
|---|---|
the_fennec f3nn3cUs z3rd4 | Reprise du message précédent :
--------------- Faudra que je teste un jour :o |
Olivie SUUUUUUUUUUUUUU | Ca y est, on peut faire tourner opus 4.6 en local ? --------------- |
neo world | Oh bordel |
Tronklou ❤❤ Vrp Bambulab à mi-temps ❤❤ |
--------------- Victime de girafophobie, mais se soigne. |
Pipould's |
L'idée c'est d'avoir plusieurs modèles dans un pipeline que tu n'utilise pas en même temps. Comme car ils sont tous en mémoire avec leur cache prefil et tu ne perds pas de temp a les charger ou en pp. |
Pipould's | Certains d'entre vous ont cherché des cartes bridge pcie ? Genre ça je suppose : Ich habe das hier gerade auf AliExpress gefunden: L'idée est d'apporter du pcie 5.0 a une carte et laisser les gpu parler entre eux a 4.0 16x. |
neo world | Jamais eu besoin. A la maison je fais du LLM que sur de la LPDDR comme un manant et au boulot tout passe en fabric Nvidia Message édité par neo world le 14-08-2026 à 21:58:49 |
Tronklou ❤❤ Vrp Bambulab à mi-temps ❤❤ |
--------------- Victime de girafophobie, mais se soigne. |
neo world | tu as mis combien en context ? il a pas juste fait un oom (crash du modèle) ou simplement dépassé son context (j'imagine que ça interompt seulement ce qu'il y avait en cours) |
the_fennec f3nn3cUs z3rd4 | Si tu parles bien de Qwen 3.8, tu peux régler le thinking sur low, medium et xhigh (default).
Message cité 1 fois Message édité par the_fennec le 15-08-2026 à 10:09:07 --------------- Faudra que je teste un jour :o |
the_fennec f3nn3cUs z3rd4 | On dirait que j'ai le même soucis, little-coder est intervenu:
Message édité par the_fennec le 15-08-2026 à 10:21:23 --------------- Faudra que je teste un jour :o |
yohaskan |
Message cité 1 fois Message édité par yohaskan le 15-08-2026 à 10:37:56 |
M300A |
J'imagine que le moteur est pas à jour, ou la template Jinja... Je sais que c'est tentant mais attends un peu que tout ça soit supporté correctement --------------- :wq |
yohaskan | Oui j'avais lu ça, Message édité par yohaskan le 15-08-2026 à 11:13:01 |
the_fennec f3nn3cUs z3rd4 | Le soucis est déjà fixé dans llama.cpp:
--------------- Faudra que je teste un jour :o |
Pipould's | Team VLLM vous etes ou ? ^^
|
neo world | Faut une grappe de GPU pour que ce soit intéressant de passer à vllm non ?
|
Plam Bear Metal | vLLM team ici, même si en mono GPU, avec pas mal de concurrence (et pas qu'une usage perso sur un seul GPU), ça tourne très bien --------------- Spécialiste du bear metal |
Pipould's |
|
M300A |
Bah DS4 Flash 0731, si un jour on reçoit 4 RTX6K en plus j'envisagerais un GLM voir un Kimi mais pour le moment je pense que je vais rien changer avant un moment. --------------- :wq |
yohaskan | Bon j'ai retenté Qwen3.8 27B pour faire le Starfox-like, mais ce coup ci via Cline VScode , pour lui signaler les bugs
Message édité par yohaskan le 15-08-2026 à 15:45:11 |
moyen_moins chat réincarné | bon, qwen 3.8, pour le moment, obligé de désactiver le mode thinking car à part me bouffer mon contexte (limité), c'est inutilisable sinon.
|
Tronklou ❤❤ Vrp Bambulab à mi-temps ❤❤ | Impossible de faire fonctionner correctement la repartition avec unsloth desktop, a chaque fois il me met des couches cpu et ca descend a 7 tok/s --------------- Victime de girafophobie, mais se soigne. |
neo world | pas de problème ici avec LM Studio et un MAC 48GB |
Tronklou ❤❤ Vrp Bambulab à mi-temps ❤❤ | C'est pas du tout les mêmes config aussi Une 3060+5070ti --------------- Victime de girafophobie, mais se soigne. |
the_fennec f3nn3cUs z3rd4 | Tout marche bien chez moi avec llama.cpp
--------------- Faudra que je teste un jour :o |
Plam Bear Metal | ça marche ici avec vLLM, en effet le thinking en xhigh par défaut ça fait du token --------------- Spécialiste du bear metal |
the_fennec f3nn3cUs z3rd4 | Sans surprise 35B devrait suivre ensuite:
--------------- Faudra que je teste un jour :o |
neo world | C'est pas idéal mais le raport qualité prix est quand même présent (bordel c'est un Mac pourtant) :
|
neo world | Qwen 3.8 :
|
Pipould's |
|
neo world | Le module chat LM studio avec un MCP d’accès à internet / recherche web. |
yohaskan | Les attentes pour les LLM de code étant différentes de celles des LLM d’instruction utilisés en temps réel (type chat), ce point vous intéressera peut-être moins.
Message cité 2 fois Message édité par yohaskan le 16-08-2026 à 11:31:27 |
Pipould's |
|

| Sujets relatifs | |
|---|---|
| [Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & co | sécurité de l'IA / agentique et des Devs en roue libre |
| Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux | |




