Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
3271 connectés 

 


Quel titre pour notre topic ?


 
27.0 %
 10 votes
1.  Infra IA : aide au choix et troubleshot de LLM Locaux
 
 
8.1 %
 3 votes
2.  Infra IA : le topic qui reveil vos GPUs
 
 
13.5 %
 5 votes
3.  IA Locale : llama.cpp, VLLM, modèles, tuning! For science. You monster.
 
 
10.8 %
 4 votes
4.  IA Locale : dresseurs de vRAM, LLM, CUDA, RocM, MLX Llama.cpp de père en fils
 
 
10.8 %
 4 votes
5.  IA Locale : votre IA selon vos termes ! (sous condition de ressources en vRAM)
 
 
5.4 %
 2 votes
6.  IA Locale : vous aussi venez mesurer votre pouvoir d'achat en HBM / GDDR / LPDDR / DDR / SDRam / EDO ...
 
 
13.5 %
 5 votes
7.  IA Locale : aucun GPU ni LLM n'a été maltraité pour cette inférence
 
 
8.1 %
 3 votes
8.  IA Locale : joignez l'inférence au chauffage de votre domicile !
 
 
2.7 %
    1 vote
9.  IA Locale : la generation generative au bercail
 

Total : 39 votes (2 votes blancs)
Sondage à 8 choix possibles.
Ce sondage est clos, vous ne pouvez plus voter
 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  32  33  34  35  36  37
Page Suivante
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°45182
the_fennec
f3nn3cUs z3rd4
Posté le 14-08-2026 à 20:21:42  profilanswer
 

Reprise du message précédent :
Qwen3.8-27B-UD-Q8_K_XL avec MTP de base, 4GB de moins que 3.6
 
https://progressive-gale-c3jf.pagedrop.io
 
13 tg/s 5min de génération  :love:  
 
 
pour rappel:

the_fennec a écrit :


 
Qwen3.6-27B UD-Q8_K_XL_MTP
 
https://nebular-tree-329n.pagedrop.io
 
11 tg/s et 11min de génération.


---------------
Faudra que je teste un jour :o
n°45183
Olivie
SUUUUUUUUUUUUUU
Posté le 14-08-2026 à 20:29:07  profilanswer
 

Ca y est, on peut faire tourner opus 4.6 en local ? :o


---------------

n°45184
the_fennec
f3nn3cUs z3rd4
Posté le 14-08-2026 à 20:32:16  profilanswer
 

Je l'ai mis au taf, on verra demain!
 
En tout cas, il semble plus rapide, moins gros, thinking configurable, MTP de base, du tout bon. Je pense qu'on va pouvoir mettre Muse au placard :o


---------------
Faudra que je teste un jour :o
n°45185
moyen_moin​s
chat réincarné
Posté le 14-08-2026 à 20:39:07  profilanswer
 

Je viens de voir les tailles, q6 ud xl ça va pas passer sur mes 2x16gb (ou alors avec off load mais perf bof bof) :/
Ou alors contexte <32 (pas d'intérêt).
Je testerai le q6 simple, je sais pas si l'ud xl apporte réellement quelque chose à ces niveaux de quantization.

n°45186
neo world
Posté le 14-08-2026 à 20:42:06  profilanswer
 

Oh bordel :love:

n°45187
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 14-08-2026 à 20:47:43  profilanswer
 

the_fennec a écrit :

Je l'ai mis au taf, on verra demain!
 
En tout cas, il semble plus rapide, moins gros, thinking configurable, MTP de base, du tout bon. Je pense qu'on va pouvoir mettre Muse au placard :o


 
En appel outils /respect du workflow très cadré, les deux sont identiques, mais sur tout le reste muse se prend une branlée :D
Nemotron a l'air pas mal aussi, en petit agent très rapide ca peut être pratique aussi


---------------
Victime de girafophobie, mais se soigne.
n°45188
the_fennec
f3nn3cUs z3rd4
Posté le 14-08-2026 à 20:52:18  profilanswer
 

J'ai l'impression que le pp est plus lent; la je suis a 100k de contexte et 60 t/s, je pense qu'en 3.6 j'étais dans les 100/s.
 
C'est peut être que j'ai repassé une BC250 en 24cu.


---------------
Faudra que je teste un jour :o
n°45189
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 14-08-2026 à 20:59:37  profilanswer
 

Là je test sur le pc avec la 3060 et la 5070ti, mais j'ai un soucis avec unsloth desktop : il décharge une partie en cpu donc ca s'écoule....
Je vais repartir de llama.cpp pour régler ca correctement


---------------
Victime de girafophobie, mais se soigne.
n°45192
Pipould's
Posté le 14-08-2026 à 21:53:13  profilanswer
 

Tronklou a écrit :

En // c'est plutot chargé et dispo ? Car sinon a chaque fois tu divise encore les tok/s de sortie drastiquement non ?

 

L'idée c'est d'avoir plusieurs modèles dans un pipeline que tu n'utilise pas en même temps. Comme car ils sont tous en mémoire avec leur cache prefil et tu ne perds pas de temp a les charger ou en pp.

n°45193
Pipould's
Posté le 14-08-2026 à 21:56:28  profilanswer
 

Certains d'entre vous ont cherché des cartes bridge pcie ?

 

Genre ça je suppose : Ich habe das hier gerade auf AliExpress gefunden:
8654 zu PCIe 4.0 x16 MCIO zu PCI-E 5.0 x16 Adapter-Baseplate 8/10 Karten 11-Slot GPU Grafikkarten für eGPU-Abstandshalter Server-Motherboard
https://a.aliexpress.com/_EySzzls

 

L'idée est d'apporter du pcie 5.0 a une carte et laisser les gpu parler entre eux a 4.0 16x.

 

n°45194
neo world
Posté le 14-08-2026 à 21:58:29  profilanswer
 

Jamais eu besoin. A la maison je fais du LLM que sur de la LPDDR comme un manant et au boulot tout passe en fabric Nvidia  [:perco_35:2]


Message édité par neo world le 14-08-2026 à 21:58:49
n°45198
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 14-08-2026 à 22:35:09  profilanswer
 

Pipould's a écrit :


 
L'idée c'est d'avoir plusieurs modèles dans un pipeline que tu n'utilise pas en même temps. Comme car ils sont tous en mémoire avec leur cache prefil et tu ne perds pas de temp a les charger ou en pp.


 
Mouais c'est vraiment spécifique de ce fait :/


---------------
Victime de girafophobie, mais se soigne.
n°45215
yohaskan
Posté le 14-08-2026 à 23:24:15  profilanswer
 

Moi je n'ai pas pu finir mon test de jeu style Starfox dans un "self-contained HTML file" , ca a reflechi pendant... 20mn (budget sans limite par defaut) en bouffant 109804 token de raisonnement.
 
Et en le limitant à 2k, hélas, le resultat n'etait pas mieux, j'ai bien un beau menu avec le message clignotant : "PRESS ENTER TO LAUNCH" mais cela ne fait ...Rien    
 
Bon j'ai pu au moins voir que ca génère à 84 token/s sur RTX5090
 
Mais je crains qu'on ai encore pas mal de problème d'Overthinking style...
but wait...  
but wait...  
but wait...

 

n°45226
neo world
Posté le 15-08-2026 à 00:01:49  profilanswer
 

tu as mis combien en context ? il a pas juste fait un oom (crash du modèle) ou simplement dépassé son context (j'imagine que ça interompt seulement ce qu'il y avait en cours)

n°45245
yohaskan
Posté le 15-08-2026 à 08:31:22  profilanswer
 

Pour le 1er jet, oui il avait dépassé son context limit ; je voulais voir a chaud sans réglage, comment il se comportait par default dans LM Studio
Pour le 2eme, même Context lengh de 200k, juste limité son budget de raisonnement à 2K

n°45254
the_fennec
f3nn3cUs z3rd4
Posté le 15-08-2026 à 10:06:59  profilanswer
 

Si tu parles bien de Qwen 3.8, tu peux régler le thinking sur low, medium et xhigh (default).
 

Code :
  1. --chat-template-kwargs '{"reasoning_effort":"low"}'

Message cité 1 fois
Message édité par the_fennec le 15-08-2026 à 10:09:07

---------------
Faudra que je teste un jour :o
n°45255
the_fennec
f3nn3cUs z3rd4
Posté le 15-08-2026 à 10:15:56  profilanswer
 

On dirait que j'ai le même soucis, little-coder est intervenu:
https://i.imgur.com/rkANkJU.png
 
ya un bug dans llama.cpp en plus:
https://www.reddit.com/r/LocalLLaMA [...] d_to_chat/


Message édité par the_fennec le 15-08-2026 à 10:21:23

---------------
Faudra que je teste un jour :o
n°45256
yohaskan
Posté le 15-08-2026 à 10:33:10  profilanswer
 

the_fennec a écrit :

Si tu parles bien de Qwen 3.8, tu peux régler le thinking sur low, medium et xhigh (default).
 

Code :
  1. --chat-template-kwargs '{"reasoning_effort":"low"}'



 
Il y est, mais LM studio s'en bat les steacks des parametres reasoning_effort et enable_thinking en low / false
 

Code :
  1. 2026-08-15 10:17:42 [DEBUG]
  2. Received request: POST to /v1/chat/completions with body  {
  3.   "model": "qwen3.8-27b",
  4.   "messages": [
  5.     {
  6.       "role": "system",
  7.       "content": "Tu es un assistant. Réponds en une phrase courte, sans réfléchir longuement."
  8.     },
  9.     {
  10.       "role": "user",
  11.       "content": "Dis-moi bonjour en une phrase."
  12.     }
  13.   ],
  14.   "temperature": 0.7,
  15.   "max_tokens": 300,
  16.   "extra_body": {
  17.     "chat_template_kwargs": {
  18.       "enable_thinking": false,
  19.       "reasoning_effort": "low"
  20.     }
  21.   },
  22.   "reasoning_effort": "low"
  23. }
  24. 2026-08-15 10:17:42  [WARN]
  25. [lmstudio-community/qwen3.8-27b] Reasoning setting 'low' is not supported by model 'lmstudio-community/Qwen3.8-27B-GGUF/Qwen3.8-27B-Q4_K_M.gguf'. Supported settings: 'on', 'off'. Falling back to reasoning setting 'on'.


 
ou via lms log stream :  

Code :
  1. modelPath: lmstudio-community/Qwen3.8-27B-GGUF/Qwen3.8-27B-Q4_K_M.gguf
  2. input:
  3. <|im_start|>system
  4. Reasoning effort is set to xhigh. Please think carefully through the task, validate key assumptions, consider plausible alternatives, and prioritize correctness, consistency, and clarity in the final answer.
  5. Tu es un assistant. Réponds en une phrase courte, sans réfléchir longuement.<|im_end|>
  6. <|im_start|>user
  7. Dis-moi bonjour en une phrase.<|im_end|>
  8. <|im_start|>assistant
  9. <think>


 
J'ia essayé avec le llm d'Unsloth, et le nouveau GGUF de Lm studio (identique à celui de Qwen, je suppose)
https://huggingface.co/lmstudio-com [...] 8-27B-GGUF

Message cité 1 fois
Message édité par yohaskan le 15-08-2026 à 10:37:56
n°45257
the_fennec
f3nn3cUs z3rd4
Posté le 15-08-2026 à 10:44:19  profilanswer
 

D'ailleurs les settings recommandés ont changé:

Code :
  1. ::Thinking Mode: temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0
  2. ::Instruct (or non-thinking) mode: temperature=0.7, top_p=0.80, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0


 
Je suis encore en temperature 0.6


---------------
Faudra que je teste un jour :o
n°45258
M300A
Posté le 15-08-2026 à 10:50:45  profilanswer
 

yohaskan a écrit :

 

Il y est, mais LM studio s'en bat les steacks des parametres reasoning_effort et enable_thinking en low / false

 
Code :
  1. 2026-08-15 10:17:42 [DEBUG]
  2. Received request: POST to /v1/chat/completions with body  {
  3.   "model": "qwen3.8-27b",
  4.   "messages": [
  5.     {
  6.       "role": "system",
  7.       "content": "Tu es un assistant. Réponds en une phrase courte, sans réfléchir longuement."
  8.     },
  9.     {
  10.       "role": "user",
  11.       "content": "Dis-moi bonjour en une phrase."
  12.     }
  13.   ],
  14.   "temperature": 0.7,
  15.   "max_tokens": 300,
  16.   "extra_body": {
  17.     "chat_template_kwargs": {
  18.       "enable_thinking": false,
  19.       "reasoning_effort": "low"
  20.     }
  21.   },
  22.   "reasoning_effort": "low"
  23. }
  24. 2026-08-15 10:17:42  [WARN]
  25. [lmstudio-community/qwen3.8-27b] Reasoning setting 'low' is not supported by model 'lmstudio-community/Qwen3.8-27B-GGUF/Qwen3.8-27B-Q4_K_M.gguf'. Supported settings: 'on', 'off'. Falling back to reasoning setting 'on'.
 

ou via lms log stream :

Code :
  1. modelPath: lmstudio-community/Qwen3.8-27B-GGUF/Qwen3.8-27B-Q4_K_M.gguf
  2. input:
  3. <|im_start|>system
  4. Reasoning effort is set to xhigh. Please think carefully through the task, validate key assumptions, consider plausible alternatives, and prioritize correctness, consistency, and clarity in the final answer.
  5. Tu es un assistant. Réponds en une phrase courte, sans réfléchir longuement.<|im_end|>
  6. <|im_start|>user
  7. Dis-moi bonjour en une phrase.<|im_end|>
  8. <|im_start|>assistant
  9. <think>
 

J'ia essayé avec le llm d'Unsloth, et le nouveau GGUF de Lm studio (identique à celui de Qwen, je suppose)
https://huggingface.co/lmstudio-com [...] 8-27B-GGUF

 

J'imagine que le moteur est pas à jour, ou la template Jinja... Je sais que c'est tentant mais attends un peu que tout ça soit supporté correctement ;)


---------------
:wq
n°45259
yohaskan
Posté le 15-08-2026 à 11:05:56  profilanswer
 

Oui j'avais lu ça,  
Un peu étrange que la temp soit plus basse en mode instruct, mais bon s'il a été entraîné comme ça...
 
mais je doute que ca change quoi que ce soit pour la désactivation de son raisonnement ou gestion de son effort.
 
Donc ouais faut attendre un fix.
C'est chiant ces lancement foireux (Muse n'etait pas mieux), mais en même temps ca a un coté Wild Wild West ces LLM ; on est des pionniers ;)


Message édité par yohaskan le 15-08-2026 à 11:13:01
n°45260
the_fennec
f3nn3cUs z3rd4
Posté le 15-08-2026 à 11:18:31  profilanswer
 

Le soucis est déjà fixé dans llama.cpp:
https://github.com/ggml-org/llama.c [...] 446bd5460a
 
:o


---------------
Faudra que je teste un jour :o
n°45264
Pipould's
Posté le 15-08-2026 à 11:43:13  profilanswer
 

Team VLLM vous etes ou ? ^^
 
Y'a pas a dire VLLM et leur technique de prefill en meme temps que generation c'est un cran a dessus de llamacpp...

n°45267
neo world
Posté le 15-08-2026 à 11:59:22  profilanswer
 

Faut une grappe de GPU pour que ce soit intéressant de passer à vllm non ?
 
Dans les tests que j’ai vu en mono gpu llama sortait un peu plus de tokens / seconde

n°45269
Plam
Bear Metal
Posté le 15-08-2026 à 12:27:46  profilanswer
 

vLLM team ici, même si en mono GPU, avec pas mal de concurrence (et pas qu'une usage perso sur un seul GPU), ça tourne très bien :jap:


---------------
Spécialiste du bear metal
n°45270
Pipould's
Posté le 15-08-2026 à 12:28:30  profilanswer
 

neo world a écrit :

Faut une grappe de GPU pour que ce soit intéressant de passer à vllm non ?
 
Dans les tests que j’ai vu en mono gpu llama sortait un peu plus de tokens / seconde


 
En sequentiel pur oui, mais des que tu touches a du claude code ou autre t'as forcement des concurrences

n°45281
M300A
Posté le 15-08-2026 à 13:28:52  profilanswer
 

Pipould's a écrit :

Team VLLM vous etes ou ? ^^

 

Y'a pas a dire VLLM et leur technique de prefill en meme temps que generation c'est un cran a dessus de llamacpp...

 

Bah DS4 Flash 0731, si un jour on reçoit 4 RTX6K en plus j'envisagerais un GLM voir un Kimi mais pour le moment je pense que je vais  rien changer avant un moment.


---------------
:wq
n°45287
yohaskan
Posté le 15-08-2026 à 15:23:20  profilanswer
 

Bon j'ai retenté Qwen3.8 27B pour faire le Starfox-like, mais ce coup ci via Cline VScode , pour lui signaler les bugs
Prompt :  
Create a spaceship game inspired by Star Fox using vanilla Three.js and HTML. It should have at least five levels, keyboard and mouse controls, enemies, and a fully functional gameplay system.
 
14:27 Thinking en masse...
14.41: 1er gabarit html vide, sections J1 à J10
14:44 fin codage j1 à J4
14:47 fin codage j5 à J10
14:47 verification du code JS
14:49 I found a real bug: inside mouseToWorld()
14H50 Completed (d'après qwen...)
 
Je lance : ok j'ai un beau menu scintillant, je lance la partie... je vois le vaisseau et l'espace qui défile... pendant 3 seconde max, avant freeze total
 

Code :
  1. Oui, j'ai bien lu ton message — et __j'ai trouvé le bug exact__. Voici le diagnostic complet :
  2. ## Diagnostic du freeze (≈ 3 s après le lancement)
  3. __Cause racine — ligne 346 de `index.html` :__ dans `makeEnemy()`, l'objet ennemi `e` est créé __sans jamais lui assigner son groupe Three.js__ :
  4. ```js
  5. const e={type,t:rand(0,6),hp:1,...};   // ← pas de propriété "group" !
  6. ...
  7. g.position.set(x,y,z);scene.add(g);enemies.push(e);return e;  // g est orphelin
  8. ```


15h07 : Completed
 
 Corrections appliquées et validées (e.group=g présent exactement 1 fois, node --check OK) :
 

Code :
  1. # Fix Ligne
  2. 1 e.group=g; ajouté dans makeEnemy() ← la cause du freeze 346
  3. 2 Particules : plus de dispose de la géométrie partagée (fuite GPU) 469
  4. 3 Filet de sécurité : toute erreur JS future s'affiche en bandeau rouge en bas à la place d'un freeze silencieux CSS + HTML + JS
  5. Teste maintenant : recharge la page, lance la partie. Tu devrais voir les drones apparaître après ~3 s, te poursuivre, et être détruisibles au tir. Si un problème persiste, le bandeau rouge en bas de l'écran t'affichera directement le message d'erreur — dis-moi ce qu'il dit et je corrige.


- Ca marche, j'ai sauvé le Royaume de Corneria  :o  
 
Le "jeu" est ici :  
https://starfaux.pagedrop.io/


Message édité par yohaskan le 15-08-2026 à 15:45:11
 Page :   1  2  3  4  5  ..  32  33  34  35  36  37
Page Suivante

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)