Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
4871 connectés 

 


Quel titre pour notre topic ?


 
27.0 %
 10 votes
1.  Infra IA : aide au choix et troubleshot de LLM Locaux
 
 
8.1 %
 3 votes
2.  Infra IA : le topic qui reveil vos GPUs
 
 
13.5 %
 5 votes
3.  IA Locale : llama.cpp, VLLM, modèles, tuning! For science. You monster.
 
 
10.8 %
 4 votes
4.  IA Locale : dresseurs de vRAM, LLM, CUDA, RocM, MLX Llama.cpp de père en fils
 
 
10.8 %
 4 votes
5.  IA Locale : votre IA selon vos termes ! (sous condition de ressources en vRAM)
 
 
5.4 %
 2 votes
6.  IA Locale : vous aussi venez mesurer votre pouvoir d'achat en HBM / GDDR / LPDDR / DDR / SDRam / EDO ...
 
 
13.5 %
 5 votes
7.  IA Locale : aucun GPU ni LLM n'a été maltraité pour cette inférence
 
 
8.1 %
 3 votes
8.  IA Locale : joignez l'inférence au chauffage de votre domicile !
 
 
2.7 %
    1 vote
9.  IA Locale : la generation generative au bercail
 

Total : 39 votes (2 votes blancs)
Sondage à 8 choix possibles.
Ce sondage est clos, vous ne pouvez plus voter
 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  36  37  38  39  40  41
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°45361
Pipould's
Posté le 16-08-2026 à 11:40:55  profilanswer
 

Reprise du message précédent :

yohaskan a écrit :

Les attentes pour les LLM de code étant différentes de celles des LLM d’instruction utilisés en temps réel (type chat), ce point vous intéressera peut-être moins.  
Mais la latence induite par le raisonnement n’est pas toujours utile, et le problème devient de plus en plus visible avec les modèles qui raisonnent de plus en plus longtemps.
 
J’ai fait un petit test avec Qwen3.8 27B, en comparant le mode thinking ON/OFF — pour l’instant le seul paramètre exploitable avec ce modèle, en attendant le correctif du bug côté Llama soit propagé aux autres runetime (LM Studio/vLLM) .
 
Sur une même série de cas :
thinking ON : raisonnement poussé au maximum (xhigh) ;
thinking OFF : réponse directe.
 
Le résultat est assez clair : thinking OFF est meilleur sur les deux axes :
Précision : 91 % vs 82 %
Latence : 0,60 s vs 4,11 s, soit environ 7× plus rapide.
 
Et certains cas sont particulièrement révélateurs.
 
Le cas calculate est probablement le plus parlant : avec thinking ON, le modèle consomme ses 1400 tokens de raisonnement et passe environ 22 secondes à réfléchir… sans jamais appeler l’outil. Avec thinking OFF, il fait également le mauvais choix (search_wiki au lieu de calculate), mais en 0,5 s. Le problème vient donc probablement davantage du prompt que d'un manque de raisonnement — mais le thinking transforme une petite erreur en énorme pénalité de latence.
 
Autre cas intéressant : pour search_wiki vs analyze_screen, le mode ON suit de manière très rigide la règle « regarde → analyze_screen() », alors que le mode OFF comprend mieux le contexte et choisit search_wiki. Le raisonnement maximal n'améliore donc pas nécessairement la compréhension : il peut aussi pousser le modèle à sur-appliquer certaines règles du prompt.
 
C'est finalement le point intéressant du test : plus de raisonnement ne signifie pas forcément de meilleures décisions, surtout lorsque la tâche demande avant tout une réponse rapide et une bonne interprétation du contexte.
 
 

Code :
  1. ======================================================================
  2. CAS : 'Triss, ça va ?'
  3. Attendu : conversation   (cas simple)
  4. ======================================================================
  5.   [on (xhigh)] essai 1/3 : ✅ sélectionné='conversation'  latence=2.25s  reasoning_tokens=85
  6.   [on (xhigh)] essai 2/3 : ✅ sélectionné='conversation'  latence=1.19s  reasoning_tokens=65
  7.   [on (xhigh)] essai 3/3 : ✅ sélectionné='conversation'  latence=1.32s  reasoning_tokens=70
  8.   [off (none)] essai 1/3 : ✅ sélectionné='conversation'  latence=0.84s  reasoning_tokens=0
  9.   [off (none)] essai 2/3 : ✅ sélectionné='conversation'  latence=0.31s  reasoning_tokens=0
  10.   [off (none)] essai 3/3 : ✅ sélectionné='conversation'  latence=0.29s  reasoning_tokens=0
  11. ======================================================================
  12. CAS : 'Triss regarde mon écran'
  13. Attendu : analyze_screen   (cas simple)
  14. ======================================================================
  15.   [on (xhigh)] essai 1/3 : ✅ sélectionné='analyze_screen'  latence=1.68s  reasoning_tokens=69
  16.   [on (xhigh)] essai 2/3 : ✅ sélectionné='analyze_screen'  latence=1.92s  reasoning_tokens=94
  17.   [on (xhigh)] essai 3/3 : ✅ sélectionné='analyze_screen'  latence=1.55s  reasoning_tokens=80
  18.   [off (none)] essai 1/3 : ✅ sélectionné='analyze_screen'  latence=0.98s  reasoning_tokens=0
  19.   [off (none)] essai 2/3 : ✅ sélectionné='analyze_screen'  latence=0.26s  reasoning_tokens=0
  20.   [off (none)] essai 3/3 : ✅ sélectionné='analyze_screen'  latence=0.23s  reasoning_tokens=0
  21. ======================================================================
  22. CAS : "Qu'est-ce qui s'est passé ces 5 dernières minutes ?"
  23. Attendu : analyze_visual_memory   (cas simple)
  24. ======================================================================
  25.   [on (xhigh)] essai 1/3 : ✅ sélectionné='analyze_visual_memory'  latence=1.98s  reasoning_tokens=66
  26.   [on (xhigh)] essai 2/3 : ✅ sélectionné='analyze_visual_memory'  latence=1.84s  reasoning_tokens=105
  27.   [on (xhigh)] essai 3/3 : ✅ sélectionné='analyze_visual_memory'  latence=1.63s  reasoning_tokens=86
  28.   [off (none)] essai 1/3 : ✅ sélectionné='analyze_visual_memory'  latence=0.99s  reasoning_tokens=0
  29.   [off (none)] essai 2/3 : ✅ sélectionné='analyze_visual_memory'  latence=0.26s  reasoning_tokens=0
  30.   [off (none)] essai 3/3 : ✅ sélectionné='analyze_visual_memory'  latence=0.25s  reasoning_tokens=0
  31. ======================================================================
  32. CAS : 'Mémorise que la base est au nord du lac'
  33. Attendu : store_memory   (cas simple)
  34. ======================================================================
  35.   [on (xhigh)] essai 1/3 : ✅ sélectionné='store_memory'  latence=3.89s  reasoning_tokens=148
  36.   [on (xhigh)] essai 2/3 : ✅ sélectionné='store_memory'  latence=3.9s  reasoning_tokens=216
  37.   [on (xhigh)] essai 3/3 : ✅ sélectionné='store_memory'  latence=3.33s  reasoning_tokens=150
  38.   [off (none)] essai 1/3 : ✅ sélectionné='store_memory'  latence=1.68s  reasoning_tokens=0
  39.   [off (none)] essai 2/3 : ✅ sélectionné='store_memory'  latence=0.84s  reasoning_tokens=0
  40.   [off (none)] essai 3/3 : ✅ sélectionné='store_memory'  latence=0.84s  reasoning_tokens=0
  41. ======================================================================
  42. CAS : "Tu te souviens de la route bleue qu'on avait notée ?"
  43. Attendu : search_memory   (cas simple)
  44. ======================================================================
  45.   [on (xhigh)] essai 1/3 : ✅ sélectionné='search_memory'  latence=2.44s  reasoning_tokens=77
  46.   [on (xhigh)] essai 2/3 : ✅ sélectionné='search_memory'  latence=2.33s  reasoning_tokens=121
  47.   [on (xhigh)] essai 3/3 : ✅ sélectionné='search_memory'  latence=1.56s  reasoning_tokens=87
  48.   [off (none)] essai 1/3 : ✅ sélectionné='search_memory'  latence=1.1s  reasoning_tokens=0
  49.   [off (none)] essai 2/3 : ✅ sélectionné='search_memory'  latence=0.36s  reasoning_tokens=0
  50.   [off (none)] essai 3/3 : ✅ sélectionné='search_memory'  latence=0.34s  reasoning_tokens=0
  51. ======================================================================
  52. CAS : 'Fais-moi un résumé de la dernière session'
  53. Attendu : get_session_summary   (cas simple)
  54. ======================================================================
  55.   [on (xhigh)] essai 1/3 : ✅ sélectionné='get_session_summary'  latence=1.97s  reasoning_tokens=61
  56.   [on (xhigh)] essai 2/3 : ✅ sélectionné='get_session_summary'  latence=1.61s  reasoning_tokens=91
  57.   [on (xhigh)] essai 3/3 : ✅ sélectionné='get_session_summary'  latence=1.43s  reasoning_tokens=74
  58.   [off (none)] essai 1/3 : ✅ sélectionné='get_session_summary'  latence=0.98s  reasoning_tokens=0
  59.   [off (none)] essai 2/3 : ✅ sélectionné='get_session_summary'  latence=0.24s  reasoning_tokens=0
  60.   [off (none)] essai 3/3 : ✅ sélectionné='get_session_summary'  latence=0.24s  reasoning_tokens=0
  61. ======================================================================
  62. CAS : "J'ai 12 clous et 8 planches, combien de barricades je peux poser ?"
  63. Attendu : calculate   (cas simple)
  64. ======================================================================
  65.   [on (xhigh)] essai 1/3 : ❌ sélectionné='search_wiki'  latence=20.23s  reasoning_tokens=1156
  66.   [on (xhigh)] essai 2/3 : ❌ sélectionné=None  latence=22.47s  reasoning_tokens=1400
  67.   [on (xhigh)] essai 3/3 : ❌ sélectionné=None  latence=22.89s  reasoning_tokens=1400
  68.   [off (none)] essai 1/3 : ❌ sélectionné='search_wiki'  latence=0.92s  reasoning_tokens=0
  69.   [off (none)] essai 2/3 : ❌ sélectionné='search_wiki'  latence=0.52s  reasoning_tokens=0
  70.   [off (none)] essai 3/3 : ❌ sélectionné='search_wiki'  latence=0.5s  reasoning_tokens=0
  71. ======================================================================
  72. CAS : "Putain ce zombie m'a eu par derrière..."
  73. Attendu : silence   (monologue, pas de nom)
  74. ======================================================================
  75.   [on (xhigh)] essai 1/3 : ✅ sélectionné='silence'  latence=3.18s  reasoning_tokens=93
  76.   [on (xhigh)] essai 2/3 : ✅ sélectionné='silence'  latence=2.04s  reasoning_tokens=115
  77.   [on (xhigh)] essai 3/3 : ✅ sélectionné='silence'  latence=3.06s  reasoning_tokens=167
  78.   [off (none)] essai 1/3 : ✅ sélectionné='silence'  latence=1.33s  reasoning_tokens=0
  79.   [off (none)] essai 2/3 : ✅ sélectionné='silence'  latence=0.57s  reasoning_tokens=0
  80.   [off (none)] essai 3/3 : ✅ sélectionné='silence'  latence=0.56s  reasoning_tokens=0
  81. ======================================================================
  82. CAS : 'Bon, je vais rouler un peu et je vais regarder mes informations concernant le personnage.'
  83. Attendu : analyze_screen   (AMBIGU — échec en prod (dialogue-PZ-03))
  84. ======================================================================
  85.   [on (xhigh)] essai 1/3 : ✅ sélectionné='analyze_screen'  latence=2.61s  reasoning_tokens=78
  86.   [on (xhigh)] essai 2/3 : ✅ sélectionné='analyze_screen'  latence=3.19s  reasoning_tokens=182
  87.   [on (xhigh)] essai 3/3 : ✅ sélectionné='analyze_screen'  latence=2.0s  reasoning_tokens=122
  88.   [off (none)] essai 1/3 : ✅ sélectionné='analyze_screen'  latence=0.64s  reasoning_tokens=0
  89.   [off (none)] essai 2/3 : ✅ sélectionné='analyze_screen'  latence=0.31s  reasoning_tokens=0
  90.   [off (none)] essai 3/3 : ✅ sélectionné='analyze_screen'  latence=0.27s  reasoning_tokens=0
  91. ======================================================================
  92. CAS : 'Triss, Réponds-moi.'
  93. Attendu : conversation   (AMBIGU — échec en prod (dialogue-PZ-03))
  94. ======================================================================
  95.   [on (xhigh)] essai 1/3 : ✅ sélectionné='conversation'  latence=2.33s  reasoning_tokens=78
  96.   [on (xhigh)] essai 2/3 : ✅ sélectionné='conversation'  latence=1.96s  reasoning_tokens=106
  97.   [on (xhigh)] essai 3/3 : ✅ sélectionné='conversation'  latence=1.57s  reasoning_tokens=75
  98.   [off (none)] essai 1/3 : ✅ sélectionné='conversation'  latence=0.6s  reasoning_tokens=0
  99.   [off (none)] essai 2/3 : ✅ sélectionné='conversation'  latence=0.28s  reasoning_tokens=0
  100.   [off (none)] essai 3/3 : ✅ sélectionné='conversation'  latence=0.27s  reasoning_tokens=0
  101. ======================================================================
  102. CAS : 'Regarde sur le wiki comment soigner une infection'
  103. Attendu : search_wiki   (AMBIGU — conflit règle 'regarde' vs 'wiki')
  104. ======================================================================
  105.   [on (xhigh)] essai 1/3 : ❌ sélectionné='analyze_screen'  latence=4.11s  reasoning_tokens=205
  106.   [on (xhigh)] essai 2/3 : ❌ sélectionné='analyze_screen'  latence=3.54s  reasoning_tokens=205
  107.   [on (xhigh)] essai 3/3 : ❌ sélectionné='analyze_screen'  latence=2.77s  reasoning_tokens=169
  108.   [off (none)] essai 1/3 : ✅ sélectionné='search_wiki'  latence=1.11s  reasoning_tokens=0
  109.   [off (none)] essai 2/3 : ✅ sélectionné='search_wiki'  latence=0.4s  reasoning_tokens=0
  110.   [off (none)] essai 3/3 : ✅ sélectionné='search_wiki'  latence=0.38s  reasoning_tokens=0
  111. ######################################################################
  112. RÉSUMÉ
  113. ######################################################################
  114. thinking ON (xhigh) (33 appels) :
  115.   précision       : 82%
  116.   latence moyenne : 4.11s
  117.   reasoning_tokens moyen : 221
  118. thinking OFF (none) (33 appels) :
  119.   précision       : 91%
  120.   latence moyenne : 0.60s
  121.   reasoning_tokens moyen : 0



 
Du coup dans quels cas de figure vois tu un avantage a avoir un raisonement ?  

n°45368
yohaskan
Posté le 16-08-2026 à 12:35:18  profilanswer
 

Hum... pour moi le raisonnement est pertinent pour les problèmes complexes, le debug, l'architecture logicielle, les maths/logique difficiles ou les agents capables d'agir puis de vérifier leur résultat.
 
À l'inverse, pour une décision simple ou un tool call évident, le temps passé à raisonner est souvent du temps perdu.  
Et pour un agent temps réel, cette latence peut même être plus pénalisante qu'une petite erreur.
 
Mais on devrait pouvoir doser  
Pour mon App de chat vocal + tools j'essaie de le rendre adaptatif  
question simple
    > thinking OFF
question complexe
    > thinking MEDIUM
tâche très complexe
   > thinking HIGH  
Avec reasoning_effort que Qwen3.8 ou Muse Spark/glimmer doivent (devrait?) comprendre
 
 
 
 

n°45371
Pipould's
Posté le 16-08-2026 à 13:37:14  profilanswer
 

yohaskan a écrit :

Hum... pour moi le raisonnement est pertinent pour les problèmes complexes, le debug, l'architecture logicielle, les maths/logique difficiles ou les agents capables d'agir puis de vérifier leur résultat.
 
À l'inverse, pour une décision simple ou un tool call évident, le temps passé à raisonner est souvent du temps perdu.  
Et pour un agent temps réel, cette latence peut même être plus pénalisante qu'une petite erreur.
 
Mais on devrait pouvoir doser  
Pour mon App de chat vocal + tools j'essaie de le rendre adaptatif  
question simple
    > thinking OFF
question complexe
    > thinking MEDIUM
tâche très complexe
   > thinking HIGH  
Avec reasoning_effort que Qwen3.8 ou Muse Spark/glimmer doivent (devrait?) comprendre
 
 
 
 


 
Comment definis-tu un agent "temps reel" ? genre < 0.3s de temps de reponse ?

n°45372
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 16-08-2026 à 14:18:25  profilanswer
 

Je suis a deux doigts de craquer le PEL et acheter une deuxième 5070ti histoire d'avoir 32gb.
Ou alors je revends tout et je me prend une R9700 :O


---------------
Victime de girafophobie, mais se soigne.
n°45373
M300A
Posté le 16-08-2026 à 14:22:06  profilanswer
 

On a besoin d'aventuriers qui testent les backends amd et intel :o


---------------
:wq
n°45374
Kyjja
Y'a pot !
Posté le 16-08-2026 à 14:24:27  profilanswer
 

Personne n'a fait remplacer la VRAM par des puces plus denses, vu que ça semble être le nerf de la guerre ?


---------------
HWBot | Conso GPU | Who's who PSU | Mes BD \o/ | GReads | MSpaint
n°45375
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 16-08-2026 à 14:31:16  profilanswer
 

Si avec les mémoire unifiée : strix halo chez amd, apple silicium chez... apple , ou encore certaines config intel.
 
Mais tu rentre dans d'autres soucis : mémoire moins rapide qu la gddr de derniere génération, absence de tensor core de chez nvidia...
 
Donc actuellement tu fait le choix entre ratio prix/mémoire ou prix/perfs.
 
En fonction du besoin tu peut aller chercher en prioritée de la mémoire, mais pour du local de mon point de vue le bon compromis c'est aux alentour de 24/32gb max.
Et apres c'est en fonction de la vitesse de sortie attendue.
 
Perso je vise plutôt une grosse vitesse de sortie, donc automatiquement c'est du gpu, pas d'autre choix disponible actuellement.


---------------
Victime de girafophobie, mais se soigne.
n°45376
neo world
Posté le 16-08-2026 à 14:40:34  profilanswer
 

y'a les M3 Ultra à 800 GB/s. Faut juste en trouver à un prix correct :o

n°45379
M300A
Posté le 16-08-2026 à 15:10:16  profilanswer
 

Et si on chope un mac comme ça, on peut le faire tourner sous Debian où on est obligé de se taper mac os  [:dileste4:5]


---------------
:wq
n°45381
neo world
Posté le 16-08-2026 à 15:17:59  profilanswer
 

tu peux passer à Asahi Linux. Faut juste pas aimer les drivers et l'acceleration en général :o :o :o

n°45384
neo world
Posté le 16-08-2026 à 16:12:20  profilanswer
 

certains ont essayé DSH ?  
 
https://deepseek.com/harness/en/

n°45387
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 16-08-2026 à 16:17:55  profilanswer
 

Je viens de migrer (douloureusement) de claudecode a opencode2, j'ai trop la flemme :O

 

Bon en RPC avec les deux bc250 mon top c'est 10.99 tok/s pour le moment, je cherche des optimisations encore.

 

Model : https://huggingface.co/AtomicChat/Qwen3.8-27B-GGUF en IQ4_XS

  

Message cité 1 fois
Message édité par Tronklou le 16-08-2026 à 16:29:41

---------------
Victime de girafophobie, mais se soigne.
n°45392
moyen_moin​s
chat réincarné
Posté le 16-08-2026 à 16:36:13  profilanswer
 

Tronklou a écrit :

Je suis a deux doigts de craquer le PEL et acheter une deuxième 5070ti histoire d'avoir 32gb.
Ou alors je revends tout et je me prend une R9700 :O


J'y pensais hier soir, avec mes 2 cartes 16Go je suis plus emmerdé qu'autre chose. Les pilotes AMD pourtant stables merdouillent complet depuis quelques releases avec lmstudio :/

n°45393
neo world
Posté le 16-08-2026 à 17:26:31  profilanswer
 

Avec vulkan ? Tu as quoi comme message d’erreur ? Linux (app image ? ) ou windows

n°45394
the_fennec
f3nn3cUs z3rd4
Posté le 16-08-2026 à 17:32:57  profilanswer
 

yohaskan a écrit :

Le cas calculate est probablement le plus parlant : avec thinking ON, le modèle consomme ses 1400 tokens de raisonnement et passe environ 22 secondes à réfléchir… sans jamais appeler l’outil. Avec thinking OFF, il fait également le mauvais choix (search_wiki au lieu de calculate), mais en 0,5 s. Le problème vient donc probablement davantage du prompt que d'un manque de raisonnement — mais le thinking transforme une petite erreur en énorme pénalité de latence.


 
Je pense que le mode thinking n'est pas valable si tu le laisse pas aller jusqu'au bout, ce qui rends le problème d'overthinking encore plus chiant.


---------------
Faudra que je teste un jour :o
n°45395
the_fennec
f3nn3cUs z3rd4
Posté le 16-08-2026 à 17:35:00  profilanswer
 

Tronklou a écrit :

Je viens de migrer (douloureusement) de claudecode a opencode2, j'ai trop la flemme :O  
 
Bon en RPC avec les deux bc250 mon top c'est 10.99 tok/s pour le moment, je cherche des optimisations encore.
 
Model : https://huggingface.co/AtomicChat/Qwen3.8-27B-GGUF en IQ4_XS
 


 
Curieux de ton retour dessus. J'ai eu de meilleurs résultats avec CC que OC ... mais peut être que la v2 est mieux?


---------------
Faudra que je teste un jour :o
n°45399
moyen_moin​s
chat réincarné
Posté le 16-08-2026 à 18:03:08  profilanswer
 

neo world a écrit :

Avec vulkan ? Tu as quoi comme message d’erreur ? Linux (app image ? ) ou windows


Vulkan, ça fait planter le driver au bout d'un certain temps, windows essaie de récupérer l'erreur, le pc freeze et terminado, ça boucle pendant des heures.
Ou alors j'ai un souci de mémoire, vu que j'ai 64+32 de marques différentes (et évidemment de timings différents) mais le kit de 64Go est passé de 130€ à 800€ :fou:

n°45401
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 16-08-2026 à 18:11:50  profilanswer
 

the_fennec a écrit :


 
Curieux de ton retour dessus. J'ai eu de meilleurs résultats avec CC que OC ... mais peut être que la v2 est mieux?


 
La v2 est top, elle corrige les principaux problèmes de la v1 pour moi : ctrl+v au lieu de ctrl+maj+v :O Les arrêts non désirés lors des loop, et surtout beaucoup beaucoup moins de conso en token et temps que CC... Enfaite CC dans mes test c'est le bon dernier absolument partout... Je l'utilise encore uniquement parceque j'ai l'abo qui va avec...
 

moyen_moins a écrit :


Vulkan, ça fait planter le driver au bout d'un certain temps, windows essaie de récupérer l'erreur, le pc freeze et terminado, ça boucle pendant des heures.
Ou alors j'ai un souci de mémoire, vu que j'ai 64+32 de marques différentes (et évidemment de timings différents) mais le kit de 64Go est passé de 130€ à 800€ :fou:


 
J'avais aussi des soucis de plantages, vérifie que t'a bien dans ton bios Resizable BAR et Above 4G Decoding d'activés, sinon t'a des erreur sur le mappage pcie quand tu dépasse 16gb.
 
Allez, 12 tok/s de moyenne MTP 3, on y crois ! :O

Message cité 2 fois
Message édité par Tronklou le 16-08-2026 à 18:31:18

---------------
Victime de girafophobie, mais se soigne.
n°45413
Olivie
SUUUUUUUUUUUUUU
Posté le 16-08-2026 à 20:29:37  profilanswer
 

Citation :

@EmperoAI
We distilled Qwen3.8-2.4T-A95B at 9B / 4B / 2B.  
 
Full-parameter SFT on curated teacher CoT. Same curriculum. Three students.  
 
MMLU CoT vs base:
9B  54.6 → 75.1  
4B  35.4 → 55.3
2B  28.3 → 54.8
 
Weights + GGUF.
https://huggingface.co/empero-ai/Qwen3.8-9B
https://huggingface.co/empero-ai/Qwen3.8-9B-GGUF


---------------

n°45417
Kyjja
Y'a pot !
Posté le 16-08-2026 à 21:06:01  profilanswer
 

Tronklou a écrit :

Si avec les mémoire unifiée : strix halo chez amd, apple silicium chez... apple , ou encore certaines config intel.

 

Mais tu rentre dans d'autres soucis : mémoire moins rapide qu la gddr de derniere génération, absence de tensor core de chez nvidia...

 

Donc actuellement tu fait le choix entre ratio prix/mémoire ou prix/perfs.

 

En fonction du besoin tu peut aller chercher en prioritée de la mémoire, mais pour du local de mon point de vue le bon compromis c'est aux alentour de 24/32gb max.
Et apres c'est en fonction de la vitesse de sortie attendue.

 

Perso je vise plutôt une grosse vitesse de sortie, donc automatiquement c'est du gpu, pas d'autre choix disponible actuellement.

 

Je voulais dire sur ses GPU, genre passer de 12 à 24 GB en dessoudant/ressoudant, m'voyez.

Message cité 1 fois
Message édité par Kyjja le 16-08-2026 à 21:23:50

---------------
HWBot | Conso GPU | Who's who PSU | Mes BD \o/ | GReads | MSpaint
n°45422
the_fennec
f3nn3cUs z3rd4
Posté le 16-08-2026 à 21:20:14  profilanswer
 

Tronklou a écrit :

La v2 est top, elle corrige les principaux problèmes de la v1 pour moi : ctrl+v au lieu de ctrl+maj+v :O Les arrêts non désirés lors des loop, et surtout beaucoup beaucoup moins de conso en token et temps que CC... Enfaite CC dans mes test c'est le bon dernier absolument partout... Je l'utilise encore uniquement parceque j'ai l'abo qui va avec...


 
C'est surtout les arrêts qui me gavaient.
La little-coder merde, c'est nouveau ... quand il compacte, llama rejette en disant qu'il veut utiliser 300k de contexte pour compacter et j'ai que 256K :/
 
Je devrais peut être retenter OC alors. Je trouvais en effet CC plus lent et consommateur de tokens, mais le résultat était aussi supérieur.


---------------
Faudra que je teste un jour :o
n°45424
the_fennec
f3nn3cUs z3rd4
Posté le 16-08-2026 à 21:21:21  profilanswer
 

Olivie a écrit :

Citation :

@EmperoAI
We distilled Qwen3.8-2.4T-A95B at 9B / 4B / 2B.  
 
Full-parameter SFT on curated teacher CoT. Same curriculum. Three students.  
 
MMLU CoT vs base:
9B  54.6 → 75.1  
4B  35.4 → 55.3
2B  28.3 → 54.8
 
Weights + GGUF.
https://huggingface.co/empero-ai/Qwen3.8-9B
https://huggingface.co/empero-ai/Qwen3.8-9B-GGUF



 
Dla merde, ça fait bien longtemps que les distil et fine-tune donnent rien.


---------------
Faudra que je teste un jour :o
n°45426
Olivie
SUUUUUUUUUUUUUU
Posté le 16-08-2026 à 21:22:47  profilanswer
 

the_fennec a écrit :


 
Dla merde, ça fait bien longtemps que les distil et fine-tune donnent rien.


Oui ben au moins ca se lance sur mon MBP 16Go :o


---------------

n°45428
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 16-08-2026 à 21:29:48  profilanswer
 

Kyjja a écrit :


 
Je voulais dire sur ses GPU, genre passer de 12 à 24 GB en dessoudant/ressoudant, m'voyez.


 
Mouais ca se fait déjà depuis un bail : peu de référence compatibles et avec le prix des modules ram qui explosent ça deviens compliqué. C'est encore rentable sur le hdg mais faut trouver la carte, trouver le service, payer les frais :/


---------------
Victime de girafophobie, mais se soigne.
n°45430
totosssfr
Pousse-testa
Posté le 16-08-2026 à 21:45:35  profilanswer
 

M300A a écrit :

On a besoin d'aventuriers qui testent les backends amd et intel :o

 

Je tourne actuellement avec une arc b60 pro 24 go (et c'est pas dit qu'une seconde ne soit pas livrée d'ici le week-end prochain).
Pour l'instant, c'est fonctionnel sous vllm version custom intel (llm-scaler-vllm).
Accessoirement, le qwen 3.6 27b q4 autoround est plus efficace pour m'aider à le dépanner que gemini flash...

 

Avec vs code + continue.dev, il m'a sorti sa première appli fonctionnelle la semaine dernière : rien de transcendant, c'était juste un gestionnaire de todo list en asp.net ultra basique.

 

Les enseignements depuis que je l'ai :
- j'ai beaucoup galèré pour comprendre ce qui fonctionne et ce qui ne fonctionne pas (merci qwen! Pas merci Gemini!). C'est pas très plug and play
- 24 go, c'est trop peu. Avec qwen 3.6 27b q4, je peux difficilement dépasser 65k de kv cache. J'aurai dû partir directement sur la b70 pro 32 go quand elle coûtait 1150€. Depuis une semaine, elle est à 1700€ (plus cher qu'une r9700). La b60 a également un peu augmenté à 800€.
- vllm a introduit un découplage entre l'appli principale et les kernels. Tout n'est pas encore dispo sur vllm-xpu-kernel mais ça avance bien.
Ce découplage permet de ne pas ralentir le développement de l'appli principale et surtout de ne pas introduire de régression parce qu'une nouveauté n'est dispo que sur cuda.
- la b60 n'est pas véloce (autours de 20tg/s) mais en contrepartie elle ne consomme pas grand chose et son refroidissement par blower permet d'en coller deux l'une au dessus de l'autre sans que l'intérieur du boîtier devienne une fournaise. Avec un poil d'undervolting/underclocking, je devrais encore améliorer l'efficacité.

 

Prochaine étape, essayer de limiter la réflexion de qwen qui a tendance à partir en thinking loop pour pas grand chose.
Je souhaite aussi mettre en place des dev containers pour sécuriser un peu ce que fait l'agent.
On verra le week-end prochain si j'ai le temps.

 

A bientôt !


---------------
Pousse tarasse forever.
n°45431
neo world
Posté le 16-08-2026 à 21:50:59  profilanswer
 

pourquoi pas une deuxième B60 ? Ca offrirait 48GB :D
 
sinon pour gemini hors thinking c'est assez bancale on va pas s'mentir. La version gratos de claude est plutôt généreuse depuis quelques semaines :jap:

Message cité 1 fois
Message édité par neo world le 16-08-2026 à 21:51:57
n°45432
totosssfr
Pousse-testa
Posté le 16-08-2026 à 22:02:15  profilanswer
 

neo world a écrit :

pourquoi pas une deuxième B60 ? Ca offrirait 48GB :D

 

sinon pour gemini hors thinking c'est assez bancale on va pas s'mentir. La version gratos de claude est plutôt généreuse depuis quelques semaines :jap:

 

La seconde b60 est dans mon panier depuis 2 jours... :o


Message édité par totosssfr le 16-08-2026 à 22:02:30

---------------
Pousse tarasse forever.
n°45433
neo world
Posté le 16-08-2026 à 22:05:13  profilanswer
 

Le meilleur moyen de résister à une tentation… bla-bla-bla achète ! :o :o :o

n°45436
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 16-08-2026 à 22:17:53  profilanswer
 

Au prix d'une b70pro maintenant je préfère essayer de choper 2x5070ti :(


---------------
Victime de girafophobie, mais se soigne.
n°45440
moyen_moin​s
chat réincarné
Posté le 16-08-2026 à 22:41:26  profilanswer
 

Tronklou a écrit :

 

J'avais aussi des soucis de plantages, vérifie que t'a bien dans ton bios Resizable BAR et Above 4G Decoding d'activés, sinon t'a des erreur sur le mappage pcie quand tu dépasse 16gb.

 

Allez, 12 tok/s de moyenne MTP 3, on y crois ! :O


Normalement tout ça c'est ok. J'ai bien de la mémoire qui déborde dans la mémoire centrale.
Sur quasi 30k tokens j'étais entre 16 et 20 tokens/s.
Par contre si je mets pas un budget de raisonnement, avec opencode ou little coder, ça raisonne à l'infini.

n°45441
sloth
Posté le 16-08-2026 à 22:47:24  profilanswer
 

Bizarre qu'ils aient pas encore les scores du qwen 3.8 27b sur Artificial Analysis.
Ils ont peut être aussi des problèmes pour tester ça?

n°45442
moyen_moin​s
chat réincarné
Posté le 16-08-2026 à 22:54:28  profilanswer
 

Je regardais pour optimiser le kv cache sur ce 3.8 27B.
J'avais déjà lu quelques articles qui disaient que q8/q8 c'était safe.
Que le K était plus sensible que le V.
Qu'a priori, une quantization asymétrique ça pourrait faire gagner encore 10% sur la taille du cache, genre q8/q5_1.

 

Faut que je teste sur le Q5_UD_XL ou Q6.

 

Par contre, j'attends le 35B MoE qui risque d'être bien plus exploitable.

n°45443
neo world
Posté le 16-08-2026 à 23:14:30  profilanswer
 

plus léger que kimi k3 et tout aussi capable dans plein de domaines : GLM 5.3  
https://z.ai/blog/glm-5.3
 
J'attends la version colibri quand même. étonnamment :o

Message cité 1 fois
Message édité par neo world le 16-08-2026 à 23:14:44
n°45444
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 16-08-2026 à 23:29:09  profilanswer
 

Allez, 24h de test plus tard :
 
Configuration finale validée :
Modèle       Qwen3.8-27B-AD-IQ4_XS.gguf
Contexte     98 304 tokens
Répartition  --split-mode layer --tensor-split 1,1
GPU          --gpu-layers all
KV           K Q8_0, V Q8_0
MTP          --spec-type draft-mtp --spec-draft-n-max 3
Seuil MTP    --spec-draft-p-min 0.5
Batch        --batch-size 2048 --ubatch-size 512
Flash attn   activé
Parallèle    1 requête
Mesures à 90 % de 96k, puis 512 tokens :
Prefill      77,81 tok/s
Génération   12,42 tok/s
Drafts       383/383 acceptés
Marge BC250-1 1,38 Gio
Marge BC250-2 4,50 Gio
À éviter :
MTP 4/6                  plus lents
KV V Q4_0                plus lent
Contextes >= 131k avec MTP  marge insuffisante
Splits asymétriques       RPC instable


---------------
Victime de girafophobie, mais se soigne.
n°45447
the_fennec
f3nn3cUs z3rd4
Posté le 16-08-2026 à 23:55:00  profilanswer
 

Olivie a écrit :


Oui ben au moins ca se lance sur mon MBP 16Go :o


 
Et c'est mieux que le modèle original?


---------------
Faudra que je teste un jour :o
n°45451
moyen_moin​s
chat réincarné
Posté le 17-08-2026 à 01:15:11  profilanswer
 

neo world a écrit :

plus léger que kimi k3 et tout aussi capable dans plein de domaines : GLM 5.3
https://z.ai/blog/glm-5.3

 

J'attends la version colibri quand même. étonnamment :o


j'aimais beaucoup la version 4.6 de GLM, j'avais réussi à faire des trucs à l'époque assez incroyables (pour moi :o).
depuis, je trouve qu'il est moins bon même si la 5.2 avait retrouvé grâce à mes yeux.

 

edit: j'ai testé la version atomic chat de qwen 3.8, s'pas mal. moins d'erreur bête dans le code généré que les versions unsloth (genre import numpy as np mais np.nan utilisé dans le code).


Message édité par moyen_moins le 17-08-2026 à 03:52:40
n°45459
the_fennec
f3nn3cUs z3rd4
Posté le 17-08-2026 à 08:08:55  profilanswer
 

Tronklou a écrit :

Allez, 24h de test plus tard :
 
Configuration finale validée :
Modèle       Qwen3.8-27B-AD-IQ4_XS.gguf
Contexte     98 304 tokens
Répartition  --split-mode layer --tensor-split 1,1
GPU          --gpu-layers all
KV           K Q8_0, V Q8_0
MTP          --spec-type draft-mtp --spec-draft-n-max 3
Seuil MTP    --spec-draft-p-min 0.5
Batch        --batch-size 2048 --ubatch-size 512
Flash attn   activé
Parallèle    1 requête
Mesures à 90 % de 96k, puis 512 tokens :
Prefill      77,81 tok/s
Génération   12,42 tok/s
Drafts       383/383 acceptés
Marge BC250-1 1,38 Gio
Marge BC250-2 4,50 Gio
À éviter :
MTP 4/6                  plus lents
KV V Q4_0                plus lent
Contextes >= 131k avec MTP  marge insuffisante
Splits asymétriques       RPC instable


 
T'as quoi comme refroidissement? Combien de CU?
 
Je sais plus exactement quelle valeur j'avais testé, mais il me semble que "batch-size 2048" bouffe pas mal de VRAM, et ça me donnait pas de meilleure vitesse.
ça fait quoi "spec-draft-p-min 0.5"?
 
Ma command line du moment:

Code :
  1. llama-server --load-mode dio --flash-attn on --metrics --alias default --host 0.0.0.0 --port 8080 --jinja --kv-unified -ctk q8_0 -ctv q8_0 -lv 4 -m X:\dev\models\Qwen3.8-27B-UD-Q8_K_XL.gguf --rpc lain:50000,arisu:50000 -ngl 99 -ts 17,17,13 -ub 512 --ctx-size 262144 --temp 0.8 --top-p 0.95 --top-k 20 --min-p 0.0 --repeat-penalty 1.0 --presence-penalty 0.0  --spec-type draft-mtp --spec-draft-n-max 3 --reasoning-effort medium


Message édité par the_fennec le 17-08-2026 à 08:09:22

---------------
Faudra que je teste un jour :o
n°45461
the_fennec
f3nn3cUs z3rd4
Posté le 17-08-2026 à 08:39:32  profilanswer
 

BC250 a 137 euros:
https://www.dealabs.com/bons-plans/ [...] 50-3394228


---------------
Faudra que je teste un jour :o
n°45462
Pipould's
Posté le 17-08-2026 à 10:44:07  profilanswer
 


 
J'en ai pris une, aucune idee de ce que je vais en faire... J'essaierai de lui faire un boitier en 3D Print...  
 
Je me demande ce que ca donnerait un cluster...
 
Y'a un discord ou un repo de docu pour l'unlock des CU etc ?  
 
merci :-)

n°45466
the_fennec
f3nn3cUs z3rd4
Posté le 17-08-2026 à 11:11:31  profilanswer
 

Pipould's a écrit :


 
J'en ai pris une, aucune idee de ce que je vais en faire... J'essaierai de lui faire un boitier en 3D Print...  
 
Je me demande ce que ca donnerait un cluster...
 
Y'a un discord ou un repo de docu pour l'unlock des CU etc ?  
 
merci :-)


 
J'ai ai deux, si on peut "appeler ça un cluster". Le problème c'est que dans llama.cpp en Vulkan le mode de distribution est "layer" ce qui rends le PP séquentiel et donc plus tu rajoutes de nodes, plus c'est lent. J'ai pas réussi à faire marcher le mode tensor qui pourrait en théorie le faire en parallèle.
 
Pour l'unlock le mieux c'est ça:
https://github.com/WinnieLV/bc250-cu-live-manager
 
Il fait aussi l'unlock du CPU, même si c'est un peu plus compliqué, il faut un reboot en plus. L'avantage est que tout est en soft, pas de BIOS ou de patch kernel, ce qui rends le truc plus simple a virer en cas de soucis.
 
Pour ce qui est du BIOS c'est la:
https://elektricm.github.io/amd-bc2 [...] roduction/
 
N'applique pas les modif kernel, pour moi tout marche avec un Kernel vanilla sur ma Debian 14. Juste ne mets pas la dernière version RC de Mesa, ça merde complètement.


Message édité par the_fennec le 17-08-2026 à 11:14:07

---------------
Faudra que je teste un jour :o
n°45474
moyen_moin​s
chat réincarné
Posté le 17-08-2026 à 13:03:46  profilanswer
 

Pipould's a écrit :


 
J'en ai pris une, aucune idee de ce que je vais en faire... J'essaierai de lui faire un boitier en 3D Print...  
 
Je me demande ce que ca donnerait un cluster...
 
Y'a un discord ou un repo de docu pour l'unlock des CU etc ?  
 
merci :-)


Pareil :)

 Page :   1  2  3  4  5  ..  36  37  38  39  40  41

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)