| |||||
Page Suivante | |
| Auteur | Sujet : Infra IA : aide au choix et troubleshot de LLM Locaux |
neo world | Reprise du message précédent : |
tfpsly Sly |
- premier essai avec Qwen3.8-27B-i1-IQ4_XS-GGUF-Smaller et 32k de contexte : 19tk/s (preprocess 380tk/s) Message édité par tfpsly le 17-09-2026 à 20:37:49 |
AllenMadison Oracle du Keb's |
--------------- Nothing much to teach, man. There's ze high, there's ze low and yall still fucking miss. |
AllenMadison Oracle du Keb's |
A terme je pense que les entreprises vont avoir besoin de gars qui gèrent l'installation d'infra IA/parametres etc, et le tout en local donc oui c'est le bon moment pour s'y mettre Pour l'instant c'est le début, y'a un rush dessus, mais ce qu'il va manquer c'est des gens qui sachent monter une vraie infra IA pour le local et il y aura une sacrée demande. Par contre l'inconvénient c'est que ça évolue très vite, toutes les 2 semaines il y a un nouveau modèle, plus perf, plus opti, plus... Mais oui un chef de projet infra IA, qui sache configurer, monter les clusters, qui sache bien adapter à la demande et qui a une bonne idée de ce qu'il faut comme capacités pour un truc potable, ça va devenir nécessaire. Message édité par AllenMadison le 17-09-2026 à 20:45:38 --------------- Nothing much to teach, man. There's ze high, there's ze low and yall still fucking miss. |
the_fennec f3nn3cUs z3rd4 |
--------------- Faudra que je teste un jour :o |
neo world | perso j'ai aucun espoir avant l'arrivée de la DDR7 et plutôt sous forme de respiration du "vieux"matos rendu obsolète (jusqu'au mac M5 / DGX 10 / Halo strix / medusa, Xiaomi ai box ...) qu'une grosse baisse de prix générale.
Message cité 1 fois Message édité par neo world le 17-09-2026 à 22:11:13 |
Tronklou ❤❤ Vrp Bambulab à mi-temps ❤❤ |
--------------- Victime de girafophobie, mais se soigne. |
the_fennec f3nn3cUs z3rd4 | PrismML a sortis son Ternary-Bonsai-2-27B-gguf basé sur qwen 3.8 27B:
--------------- Faudra que je teste un jour :o |
neo world | Ils font des des versions de deepseek flash 4.1 avec ça ? |
the_fennec f3nn3cUs z3rd4 |
neo world |
|
lapin |
|
Olivie SUUUUUUUUUUUUUU |
Message cité 1 fois Message édité par Olivie le 18-09-2026 à 06:17:51 --------------- |
tfpsly Sly |
|
the_fennec f3nn3cUs z3rd4 |
--------------- Faudra que je teste un jour :o |
the_fennec f3nn3cUs z3rd4 |
--------------- Faudra que je teste un jour :o |
sardhaukar |
|
moyen_moins chat réincarné |
|
the_fennec f3nn3cUs z3rd4 |
--------------- Faudra que je teste un jour :o |
Olivie SUUUUUUUUUUUUUU |
--------------- |
moyen_moins chat réincarné |
Message cité 1 fois Message édité par moyen_moins le 18-09-2026 à 11:13:30 |
tfpsly Sly | Qwen 3.8 en MTP qui tourne à 45 tk/s (preprompt 870 tk/s) sur ma 5060 Ti Par contre je ne peux plus avoir de navigateur ouvert; moins de 400mb de VRAM dispo. https://www.reddit.com/r/LocalLLM/c [...] ingle_rtx/
Message cité 1 fois Message édité par tfpsly le 18-09-2026 à 12:20:04 |
the_fennec f3nn3cUs z3rd4 |
--------------- Faudra que je teste un jour :o |
the_fennec f3nn3cUs z3rd4 |
--------------- Faudra que je teste un jour :o |
tfpsly Sly |
La commande au dessus est instable; trop proche de 100% de toute la VRAM, et parfois ça ne se lance pas (fragmentation de la VRAM je suppose).
Message édité par tfpsly le 18-09-2026 à 13:38:59 |
moyen_moins chat réincarné |
|
lapin |
|
tfpsly Sly |
Vraiment surpris par la dernière ligne de commande suggérée par Gemini (au dessus puis modifiée à la main) : contexte de 34k (32k dans le settings.json de pi.dev, parce qu'il envoie parfois des requête plus larges); ça tient intégralement en VRAM (15025MiB / 16311MiB); et maintenant il me reste 1gb de VRAM (je devrais pouvoir remettre l'accélération hw dans Firefox).
EDIT - context size 65536 passe encore mieux; moins d'échec/retry dans pi.dev Message cité 1 fois Message édité par tfpsly le 18-09-2026 à 16:48:58 |
the_fennec f3nn3cUs z3rd4 |
--------------- Faudra que je teste un jour :o |
tfpsly Sly |
OK pour un usage seul; pas pour partager un modèle entre plusieurs utilisateurs ou usage (ex, coder et avoir un chatbot dans le browser). Par contre, Qwen3.8 utilise plus de contexte que 3.6 (plus de réflexions), et il faut compacter le contexte plus souvent. Message édité par tfpsly le 18-09-2026 à 14:42:21 |
the_fennec f3nn3cUs z3rd4 | Ha oui, -p 1, c'est 4 par défaut il me semble. --------------- Faudra que je teste un jour :o |
Olivie SUUUUUUUUUUUUUU |
Fredouye Shivers ! | 768gb vram for less than the price of one RTX 6000
--------------- Le dernier arrivé est fan de Phil Collins |
Tronklou ❤❤ Vrp Bambulab à mi-temps ❤❤ | Trop propre, pas assez diy, ca manque de scotch, recalé --------------- Victime de girafophobie, mais se soigne. |
the_fennec f3nn3cUs z3rd4 |
--------------- Faudra que je teste un jour :o |
neo world | fallait juste acheter avant que les prix grimpent |
Pipould's | Le mec a clairement pecho ses 170 AVANT LA HYPE du model. |
Tronklou ❤❤ Vrp Bambulab à mi-temps ❤❤ | C'est du W3BCOUD donc ouais clairement c'etait un gros rig de minage acheté à l'époque --------------- Victime de girafophobie, mais se soigne. |
tfpsly Sly | Un Redditeur a comparé Claude Sonnet 5, Claude Opus 4.6 et Qwen 3.8 27B sur un bench. Qwen est derrière, mais pas dégueulasse !
Après quelques jours à faire tourner 3.8 vs 3.6 avant : 3.6 a tendance à pisser plein de code, bien trop; 3.8 prend plus son temps, réfléchit plus longtemps, puis fait des changements plus chirurgicaux. En gros 3.6 = SWE débuttant qui veut pondre un max de code, et 3.8 semble plus être un SWE expérimenté. Message édité par tfpsly le 19-09-2026 à 20:52:16 |
Page Suivante |
| Sujets relatifs | |
|---|---|
| [Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & co | sécurité de l'IA / agentique et des Devs en roue libre |
| Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux | |





