Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
3787 connectés 

 


Dernière réponse
Sujet : Infra IA : aide au choix et troubleshot de LLM Locaux
Tronklou Impossible de faire fonctionner correctement la repartition avec unsloth desktop, a chaque fois il me met des couches cpu et ca descend a 7 tok/s :O
 
Quand les bc250 sont de nouveaux libre je me rabat dessus avec llama.cpp :D

Votre réponse
Nom d'utilisateur    Pour poster, vous devez être inscrit sur ce forum .... si ce n'est pas le cas, cliquez ici !
Le ton de votre message                        
                       
Votre réponse


[b][i][u][strike][spoiler][fixed][cpp][url][email][img][*]   
 
   [quote]
 

Options

 
Vous avez perdu votre mot de passe ?


Vue Rapide de la discussion
Tronklou Impossible de faire fonctionner correctement la repartition avec unsloth desktop, a chaque fois il me met des couches cpu et ca descend a 7 tok/s :O
 
Quand les bc250 sont de nouveaux libre je me rabat dessus avec llama.cpp :D
moyen_moins bon, qwen 3.8, pour le moment, obligé de désactiver le mode thinking car à part me bouffer mon contexte (limité), c'est inutilisable sinon.
et le machin d'unsloth là  [:ograoum papas:1]
yohaskan Bon j'ai retenté Qwen3.8 27B pour faire le Starfox-like, mais ce coup ci via Cline VScode , pour lui signaler les bugs
Prompt :  
Create a spaceship game inspired by Star Fox using vanilla Three.js and HTML. It should have at least five levels, keyboard and mouse controls, enemies, and a fully functional gameplay system.
 
14:27 Thinking en masse...
14.41: 1er gabarit html vide, sections J1 à J10
14:44 fin codage j1 à J4
14:47 fin codage j5 à J10
14:47 verification du code JS
14:49 I found a real bug: inside mouseToWorld()
14H50 Completed (d'après qwen...)
 
Je lance : ok j'ai un beau menu scintillant, je lance la partie... je vois le vaisseau et l'espace qui défile... pendant 3 seconde max, avant freeze total
 

Code :
  1. Oui, j'ai bien lu ton message — et __j'ai trouvé le bug exact__. Voici le diagnostic complet :
  2. ## Diagnostic du freeze (≈ 3 s après le lancement)
  3. __Cause racine — ligne 346 de `index.html` :__ dans `makeEnemy()`, l'objet ennemi `e` est créé __sans jamais lui assigner son groupe Three.js__ :
  4. ```js
  5. const e={type,t:rand(0,6),hp:1,...};   // ← pas de propriété "group" !
  6. ...
  7. g.position.set(x,y,z);scene.add(g);enemies.push(e);return e;  // g est orphelin
  8. ```


15h07 : Completed
 
 Corrections appliquées et validées (e.group=g présent exactement 1 fois, node --check OK) :
 

Code :
  1. # Fix Ligne
  2. 1 e.group=g; ajouté dans makeEnemy() ← la cause du freeze 346
  3. 2 Particules : plus de dispose de la géométrie partagée (fuite GPU) 469
  4. 3 Filet de sécurité : toute erreur JS future s'affiche en bandeau rouge en bas à la place d'un freeze silencieux CSS + HTML + JS
  5. Teste maintenant : recharge la page, lance la partie. Tu devrais voir les drones apparaître après ~3 s, te poursuivre, et être détruisibles au tir. Si un problème persiste, le bandeau rouge en bas de l'écran t'affichera directement le message d'erreur — dis-moi ce qu'il dit et je corrige.


- Ca marche, j'ai sauvé le Royaume de Corneria  :o  
 
Le "jeu" est ici :  
https://starfaux.pagedrop.io/

M300A

Pipould's a écrit :

Team VLLM vous etes ou ? ^^

 

Y'a pas a dire VLLM et leur technique de prefill en meme temps que generation c'est un cran a dessus de llamacpp...

 

Bah DS4 Flash 0731, si un jour on reçoit 4 RTX6K en plus j'envisagerais un GLM voir un Kimi mais pour le moment je pense que je vais  rien changer avant un moment.

Pipould's

neo world a écrit :

Faut une grappe de GPU pour que ce soit intéressant de passer à vllm non ?
 
Dans les tests que j’ai vu en mono gpu llama sortait un peu plus de tokens / seconde


 
En sequentiel pur oui, mais des que tu touches a du claude code ou autre t'as forcement des concurrences

Plam vLLM team ici, même si en mono GPU, avec pas mal de concurrence (et pas qu'une usage perso sur un seul GPU), ça tourne très bien :jap:
neo world Faut une grappe de GPU pour que ce soit intéressant de passer à vllm non ?
 
Dans les tests que j’ai vu en mono gpu llama sortait un peu plus de tokens / seconde
Pipould's Team VLLM vous etes ou ? ^^
 
Y'a pas a dire VLLM et leur technique de prefill en meme temps que generation c'est un cran a dessus de llamacpp...
the_fennec Le soucis est déjà fixé dans llama.cpp:
https://github.com/ggml-org/llama.c [...] 446bd5460a
 
:o
yohaskan Oui j'avais lu ça,  
Un peu étrange que la temp soit plus basse en mode instruct, mais bon s'il a été entraîné comme ça...
 
mais je doute que ca change quoi que ce soit pour la désactivation de son raisonnement ou gestion de son effort.
 
Donc ouais faut attendre un fix.
C'est chiant ces lancement foireux (Muse n'etait pas mieux), mais en même temps ca a un coté Wild Wild West ces LLM ; on est des pionniers ;)
M300A

yohaskan a écrit :

 

Il y est, mais LM studio s'en bat les steacks des parametres reasoning_effort et enable_thinking en low / false

 
Code :
  1. 2026-08-15 10:17:42 [DEBUG]
  2. Received request: POST to /v1/chat/completions with body  {
  3.   "model": "qwen3.8-27b",
  4.   "messages": [
  5.     {
  6.       "role": "system",
  7.       "content": "Tu es un assistant. Réponds en une phrase courte, sans réfléchir longuement."
  8.     },
  9.     {
  10.       "role": "user",
  11.       "content": "Dis-moi bonjour en une phrase."
  12.     }
  13.   ],
  14.   "temperature": 0.7,
  15.   "max_tokens": 300,
  16.   "extra_body": {
  17.     "chat_template_kwargs": {
  18.       "enable_thinking": false,
  19.       "reasoning_effort": "low"
  20.     }
  21.   },
  22.   "reasoning_effort": "low"
  23. }
  24. 2026-08-15 10:17:42  [WARN]
  25. [lmstudio-community/qwen3.8-27b] Reasoning setting 'low' is not supported by model 'lmstudio-community/Qwen3.8-27B-GGUF/Qwen3.8-27B-Q4_K_M.gguf'. Supported settings: 'on', 'off'. Falling back to reasoning setting 'on'.
 

ou via lms log stream :

Code :
  1. modelPath: lmstudio-community/Qwen3.8-27B-GGUF/Qwen3.8-27B-Q4_K_M.gguf
  2. input:
  3. <|im_start|>system
  4. Reasoning effort is set to xhigh. Please think carefully through the task, validate key assumptions, consider plausible alternatives, and prioritize correctness, consistency, and clarity in the final answer.
  5. Tu es un assistant. Réponds en une phrase courte, sans réfléchir longuement.<|im_end|>
  6. <|im_start|>user
  7. Dis-moi bonjour en une phrase.<|im_end|>
  8. <|im_start|>assistant
  9. <think>
 

J'ia essayé avec le llm d'Unsloth, et le nouveau GGUF de Lm studio (identique à celui de Qwen, je suppose)
https://huggingface.co/lmstudio-com [...] 8-27B-GGUF

 

J'imagine que le moteur est pas à jour, ou la template Jinja... Je sais que c'est tentant mais attends un peu que tout ça soit supporté correctement ;)

the_fennec D'ailleurs les settings recommandés ont changé:

Code :
  1. ::Thinking Mode: temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0
  2. ::Instruct (or non-thinking) mode: temperature=0.7, top_p=0.80, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0


 
Je suis encore en temperature 0.6

yohaskan

the_fennec a écrit :

Si tu parles bien de Qwen 3.8, tu peux régler le thinking sur low, medium et xhigh (default).
 

Code :
  1. --chat-template-kwargs '{"reasoning_effort":"low"}'



 
Il y est, mais LM studio s'en bat les steacks des parametres reasoning_effort et enable_thinking en low / false
 

Code :
  1. 2026-08-15 10:17:42 [DEBUG]
  2. Received request: POST to /v1/chat/completions with body  {
  3.   "model": "qwen3.8-27b",
  4.   "messages": [
  5.     {
  6.       "role": "system",
  7.       "content": "Tu es un assistant. Réponds en une phrase courte, sans réfléchir longuement."
  8.     },
  9.     {
  10.       "role": "user",
  11.       "content": "Dis-moi bonjour en une phrase."
  12.     }
  13.   ],
  14.   "temperature": 0.7,
  15.   "max_tokens": 300,
  16.   "extra_body": {
  17.     "chat_template_kwargs": {
  18.       "enable_thinking": false,
  19.       "reasoning_effort": "low"
  20.     }
  21.   },
  22.   "reasoning_effort": "low"
  23. }
  24. 2026-08-15 10:17:42  [WARN]
  25. [lmstudio-community/qwen3.8-27b] Reasoning setting 'low' is not supported by model 'lmstudio-community/Qwen3.8-27B-GGUF/Qwen3.8-27B-Q4_K_M.gguf'. Supported settings: 'on', 'off'. Falling back to reasoning setting 'on'.


 
ou via lms log stream :  

Code :
  1. modelPath: lmstudio-community/Qwen3.8-27B-GGUF/Qwen3.8-27B-Q4_K_M.gguf
  2. input:
  3. <|im_start|>system
  4. Reasoning effort is set to xhigh. Please think carefully through the task, validate key assumptions, consider plausible alternatives, and prioritize correctness, consistency, and clarity in the final answer.
  5. Tu es un assistant. Réponds en une phrase courte, sans réfléchir longuement.<|im_end|>
  6. <|im_start|>user
  7. Dis-moi bonjour en une phrase.<|im_end|>
  8. <|im_start|>assistant
  9. <think>


 
J'ia essayé avec le llm d'Unsloth, et le nouveau GGUF de Lm studio (identique à celui de Qwen, je suppose)
https://huggingface.co/lmstudio-com [...] 8-27B-GGUF

the_fennec On dirait que j'ai le même soucis, little-coder est intervenu:
https://i.imgur.com/rkANkJU.png  
 
ya un bug dans llama.cpp en plus:
https://www.reddit.com/r/LocalLLaMA [...] d_to_chat/
the_fennec Si tu parles bien de Qwen 3.8, tu peux régler le thinking sur low, medium et xhigh (default).
 

Code :
  1. --chat-template-kwargs '{"reasoning_effort":"low"}'

yohaskan Pour le 1er jet, oui il avait dépassé son context limit ; je voulais voir a chaud sans réglage, comment il se comportait par default dans LM Studio
Pour le 2eme, même Context lengh de 200k, juste limité son budget de raisonnement à 2K
neo world tu as mis combien en context ? il a pas juste fait un oom (crash du modèle) ou simplement dépassé son context (j'imagine que ça interompt seulement ce qu'il y avait en cours)
yohaskan Moi je n'ai pas pu finir mon test de jeu style Starfox dans un "self-contained HTML file" , ca a reflechi pendant... 20mn (budget sans limite par defaut) en bouffant 109804 token de raisonnement.
 
Et en le limitant à 2k, hélas, le resultat n'etait pas mieux, j'ai bien un beau menu avec le message clignotant : "PRESS ENTER TO LAUNCH" mais cela ne fait ...Rien    
 
Bon j'ai pu au moins voir que ca génère à 84 token/s sur RTX5090
 
Mais je crains qu'on ai encore pas mal de problème d'Overthinking style...
but wait...  
but wait...  
but wait...

 
Tronklou

Pipould's a écrit :


 
L'idée c'est d'avoir plusieurs modèles dans un pipeline que tu n'utilise pas en même temps. Comme car ils sont tous en mémoire avec leur cache prefil et tu ne perds pas de temp a les charger ou en pp.


 
Mouais c'est vraiment spécifique de ce fait :/

neo world Jamais eu besoin. A la maison je fais du LLM que sur de la LPDDR comme un manant et au boulot tout passe en fabric Nvidia  [:perco_35:2]
Pipould's Certains d'entre vous ont cherché des cartes bridge pcie ?

 

Genre ça je suppose : Ich habe das hier gerade auf AliExpress gefunden:
8654 zu PCIe 4.0 x16 MCIO zu PCI-E 5.0 x16 Adapter-Baseplate 8/10 Karten 11-Slot GPU Grafikkarten für eGPU-Abstandshalter Server-Motherboard
https://a.aliexpress.com/_EySzzls

 

L'idée est d'apporter du pcie 5.0 a une carte et laisser les gpu parler entre eux a 4.0 16x.

 

Pipould's

Tronklou a écrit :

En // c'est plutot chargé et dispo ? Car sinon a chaque fois tu divise encore les tok/s de sortie drastiquement non ?

 

L'idée c'est d'avoir plusieurs modèles dans un pipeline que tu n'utilise pas en même temps. Comme car ils sont tous en mémoire avec leur cache prefil et tu ne perds pas de temp a les charger ou en pp.

Tronklou Là je test sur le pc avec la 3060 et la 5070ti, mais j'ai un soucis avec unsloth desktop : il décharge une partie en cpu donc ca s'écoule....
Je vais repartir de llama.cpp pour régler ca correctement
the_fennec J'ai l'impression que le pp est plus lent; la je suis a 100k de contexte et 60 t/s, je pense qu'en 3.6 j'étais dans les 100/s.
 
C'est peut être que j'ai repassé une BC250 en 24cu.
Tronklou

the_fennec a écrit :

Je l'ai mis au taf, on verra demain!
 
En tout cas, il semble plus rapide, moins gros, thinking configurable, MTP de base, du tout bon. Je pense qu'on va pouvoir mettre Muse au placard :o


 
En appel outils /respect du workflow très cadré, les deux sont identiques, mais sur tout le reste muse se prend une branlée :D
Nemotron a l'air pas mal aussi, en petit agent très rapide ca peut être pratique aussi

neo world Oh bordel :love:
moyen_moins Je viens de voir les tailles, q6 ud xl ça va pas passer sur mes 2x16gb (ou alors avec off load mais perf bof bof) :/
Ou alors contexte <32 (pas d'intérêt).
Je testerai le q6 simple, je sais pas si l'ud xl apporte réellement quelque chose à ces niveaux de quantization.
the_fennec Je l'ai mis au taf, on verra demain!
 
En tout cas, il semble plus rapide, moins gros, thinking configurable, MTP de base, du tout bon. Je pense qu'on va pouvoir mettre Muse au placard :o
Olivie Ca y est, on peut faire tourner opus 4.6 en local ? :o
the_fennec Qwen3.8-27B-UD-Q8_K_XL avec MTP de base, 4GB de moins que 3.6
 
https://progressive-gale-c3jf.pagedrop.io
 
13 tg/s 5min de génération  :love:  
 
 
pour rappel:

the_fennec a écrit :


 
Qwen3.6-27B UD-Q8_K_XL_MTP
 
https://nebular-tree-329n.pagedrop.io
 
11 tg/s et 11min de génération.


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)