| |||||
Page Suivante | |
| Auteur | Sujet : Infra IA : aide au choix et troubleshot de LLM Locaux |
the_fennec f3nn3cUs z3rd4 | Reprise du message précédent :
--------------- Faudra que je teste un jour :o |
Olivie SUUUUUUUUUUUUUU | Ca y est, on peut faire tourner opus 4.6 en local ? --------------- |
neo world | Oh bordel |
Tronklou ❤❤ Vrp Bambulab à mi-temps ❤❤ |
--------------- Victime de girafophobie, mais se soigne. |
Pipould's |
L'idée c'est d'avoir plusieurs modèles dans un pipeline que tu n'utilise pas en même temps. Comme car ils sont tous en mémoire avec leur cache prefil et tu ne perds pas de temp a les charger ou en pp. |
Pipould's | Certains d'entre vous ont cherché des cartes bridge pcie ? Genre ça je suppose : Ich habe das hier gerade auf AliExpress gefunden: L'idée est d'apporter du pcie 5.0 a une carte et laisser les gpu parler entre eux a 4.0 16x. |
neo world | Jamais eu besoin. A la maison je fais du LLM que sur de la LPDDR comme un manant et au boulot tout passe en fabric Nvidia Message édité par neo world le 14-08-2026 à 21:58:49 |
Tronklou ❤❤ Vrp Bambulab à mi-temps ❤❤ |
--------------- Victime de girafophobie, mais se soigne. |
neo world | tu as mis combien en context ? il a pas juste fait un oom (crash du modèle) ou simplement dépassé son context (j'imagine que ça interompt seulement ce qu'il y avait en cours) |
the_fennec f3nn3cUs z3rd4 | Si tu parles bien de Qwen 3.8, tu peux régler le thinking sur low, medium et xhigh (default).
Message cité 1 fois Message édité par the_fennec le 15-08-2026 à 10:09:07 --------------- Faudra que je teste un jour :o |
the_fennec f3nn3cUs z3rd4 | On dirait que j'ai le même soucis, little-coder est intervenu:
Message édité par the_fennec le 15-08-2026 à 10:21:23 --------------- Faudra que je teste un jour :o |
yohaskan |
Message cité 1 fois Message édité par yohaskan le 15-08-2026 à 10:37:56 |
M300A |
J'imagine que le moteur est pas à jour, ou la template Jinja... Je sais que c'est tentant mais attends un peu que tout ça soit supporté correctement --------------- :wq |
yohaskan | Oui j'avais lu ça, Message édité par yohaskan le 15-08-2026 à 11:13:01 |
the_fennec f3nn3cUs z3rd4 | Le soucis est déjà fixé dans llama.cpp:
--------------- Faudra que je teste un jour :o |
Pipould's | Team VLLM vous etes ou ? ^^
|
neo world | Faut une grappe de GPU pour que ce soit intéressant de passer à vllm non ?
|
Plam Bear Metal | vLLM team ici, même si en mono GPU, avec pas mal de concurrence (et pas qu'une usage perso sur un seul GPU), ça tourne très bien --------------- Spécialiste du bear metal |
Pipould's |
|
M300A |
Bah DS4 Flash 0731, si un jour on reçoit 4 RTX6K en plus j'envisagerais un GLM voir un Kimi mais pour le moment je pense que je vais rien changer avant un moment. --------------- :wq |
yohaskan | Bon j'ai retenté Qwen3.8 27B pour faire le Starfox-like, mais ce coup ci via Cline VScode , pour lui signaler les bugs
Message édité par yohaskan le 15-08-2026 à 15:45:11 |
Page Suivante |
| Sujets relatifs | |
|---|---|
| [Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & co | sécurité de l'IA / agentique et des Devs en roue libre |
| Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux | |





