Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
4045 connectés 

 


Je génère ...


 
8.3 %
 2 votes
1.  moins de 100k tokens par jour
 
 
4.2 %
 1 vote
2.  entre 100k et 500k tokens par jour
 
 
8.3 %
 2 votes
3.  Entre 500 et 1M de tokens par jour
 
 
8.3 %
 2 votes
4.  Entre 1M et 5M de tokens par jour
 
 
4.2 %
 1 vote
5.  5M+
 
 
12.5 %
 3 votes
6.  10M+
 
 
20.8 %
 5 votes
7.  La quantité c'est dans la tête, tout est dans la qualité du jeton
 
 
20.8 %
 5 votes
8.  Quand on aime on ne compte pas (j'en ait aucune idée :o )
 
 
4.2 %
 1 vote
9.  C'est quoi ce token maxing de merde ? je dedrap le topic !
 
 
8.3 %
 2 votes
10.  zero, je lurke et je produis mon token seulement biologiquement
 

Total : 25 votes (1 vote blanc)
Sondage à 3 choix possibles.
Ce sondage est clos, vous ne pouvez plus voter
 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  36  37  38  ..  68  69  70  71  72  73
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°45182
the_fennec
f3nn3cUs z3rd4
Posté le 14-08-2026 à 20:21:42  profilanswer
 

Reprise du message précédent :
Qwen3.8-27B-UD-Q8_K_XL avec MTP de base, 4GB de moins que 3.6
 
https://progressive-gale-c3jf.pagedrop.io
 
13 tg/s 5min de génération  :love:  
 
 
pour rappel:

the_fennec a écrit :


 
Qwen3.6-27B UD-Q8_K_XL_MTP
 
https://nebular-tree-329n.pagedrop.io
 
11 tg/s et 11min de génération.


---------------
Faudra que je teste un jour :o
n°45183
Olivie
SUUUUUUUUUUUUUU
Posté le 14-08-2026 à 20:29:07  profilanswer
 

Ca y est, on peut faire tourner opus 4.6 en local ? :o


---------------

n°45184
the_fennec
f3nn3cUs z3rd4
Posté le 14-08-2026 à 20:32:16  profilanswer
 

Je l'ai mis au taf, on verra demain!
 
En tout cas, il semble plus rapide, moins gros, thinking configurable, MTP de base, du tout bon. Je pense qu'on va pouvoir mettre Muse au placard :o


---------------
Faudra que je teste un jour :o
n°45185
moyen_moin​s
chat réincarné
Posté le 14-08-2026 à 20:39:07  profilanswer
 

Je viens de voir les tailles, q6 ud xl ça va pas passer sur mes 2x16gb (ou alors avec off load mais perf bof bof) :/
Ou alors contexte <32 (pas d'intérêt).
Je testerai le q6 simple, je sais pas si l'ud xl apporte réellement quelque chose à ces niveaux de quantization.

n°45186
neo world
Posté le 14-08-2026 à 20:42:06  profilanswer
 

Oh bordel :love:

n°45187
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 14-08-2026 à 20:47:43  profilanswer
 

the_fennec a écrit :

Je l'ai mis au taf, on verra demain!
 
En tout cas, il semble plus rapide, moins gros, thinking configurable, MTP de base, du tout bon. Je pense qu'on va pouvoir mettre Muse au placard :o


 
En appel outils /respect du workflow très cadré, les deux sont identiques, mais sur tout le reste muse se prend une branlée :D
Nemotron a l'air pas mal aussi, en petit agent très rapide ca peut être pratique aussi


---------------
Victime de girafophobie, mais se soigne.
n°45188
the_fennec
f3nn3cUs z3rd4
Posté le 14-08-2026 à 20:52:18  profilanswer
 

J'ai l'impression que le pp est plus lent; la je suis a 100k de contexte et 60 t/s, je pense qu'en 3.6 j'étais dans les 100/s.
 
C'est peut être que j'ai repassé une BC250 en 24cu.


---------------
Faudra que je teste un jour :o
n°45189
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 14-08-2026 à 20:59:37  profilanswer
 

Là je test sur le pc avec la 3060 et la 5070ti, mais j'ai un soucis avec unsloth desktop : il décharge une partie en cpu donc ca s'écoule....
Je vais repartir de llama.cpp pour régler ca correctement


---------------
Victime de girafophobie, mais se soigne.
n°45192
Pipould's
Posté le 14-08-2026 à 21:53:13  profilanswer
 

Tronklou a écrit :

En // c'est plutot chargé et dispo ? Car sinon a chaque fois tu divise encore les tok/s de sortie drastiquement non ?

 

L'idée c'est d'avoir plusieurs modèles dans un pipeline que tu n'utilise pas en même temps. Comme car ils sont tous en mémoire avec leur cache prefil et tu ne perds pas de temp a les charger ou en pp.

n°45193
Pipould's
Posté le 14-08-2026 à 21:56:28  profilanswer
 

Certains d'entre vous ont cherché des cartes bridge pcie ?

 

Genre ça je suppose : Ich habe das hier gerade auf AliExpress gefunden:
8654 zu PCIe 4.0 x16 MCIO zu PCI-E 5.0 x16 Adapter-Baseplate 8/10 Karten 11-Slot GPU Grafikkarten für eGPU-Abstandshalter Server-Motherboard
https://a.aliexpress.com/_EySzzls

 

L'idée est d'apporter du pcie 5.0 a une carte et laisser les gpu parler entre eux a 4.0 16x.

 

n°45194
neo world
Posté le 14-08-2026 à 21:58:29  profilanswer
 

Jamais eu besoin. A la maison je fais du LLM que sur de la LPDDR comme un manant et au boulot tout passe en fabric Nvidia  [:perco_35:2]


Message édité par neo world le 14-08-2026 à 21:58:49
n°45198
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 14-08-2026 à 22:35:09  profilanswer
 

Pipould's a écrit :


 
L'idée c'est d'avoir plusieurs modèles dans un pipeline que tu n'utilise pas en même temps. Comme car ils sont tous en mémoire avec leur cache prefil et tu ne perds pas de temp a les charger ou en pp.


 
Mouais c'est vraiment spécifique de ce fait :/


---------------
Victime de girafophobie, mais se soigne.
n°45215
yohaskan
Posté le 14-08-2026 à 23:24:15  profilanswer
 

Moi je n'ai pas pu finir mon test de jeu style Starfox dans un "self-contained HTML file" , ca a reflechi pendant... 20mn (budget sans limite par defaut) en bouffant 109804 token de raisonnement.
 
Et en le limitant à 2k, hélas, le resultat n'etait pas mieux, j'ai bien un beau menu avec le message clignotant : "PRESS ENTER TO LAUNCH" mais cela ne fait ...Rien    
 
Bon j'ai pu au moins voir que ca génère à 84 token/s sur RTX5090
 
Mais je crains qu'on ai encore pas mal de problème d'Overthinking style...
but wait...  
but wait...  
but wait...

 

n°45226
neo world
Posté le 15-08-2026 à 00:01:49  profilanswer
 

tu as mis combien en context ? il a pas juste fait un oom (crash du modèle) ou simplement dépassé son context (j'imagine que ça interompt seulement ce qu'il y avait en cours)

n°45245
yohaskan
Posté le 15-08-2026 à 08:31:22  profilanswer
 

Pour le 1er jet, oui il avait dépassé son context limit ; je voulais voir a chaud sans réglage, comment il se comportait par default dans LM Studio
Pour le 2eme, même Context lengh de 200k, juste limité son budget de raisonnement à 2K

n°45254
the_fennec
f3nn3cUs z3rd4
Posté le 15-08-2026 à 10:06:59  profilanswer
 

Si tu parles bien de Qwen 3.8, tu peux régler le thinking sur low, medium et xhigh (default).
 

Code :
  1. --chat-template-kwargs '{"reasoning_effort":"low"}'

Message cité 1 fois
Message édité par the_fennec le 15-08-2026 à 10:09:07

---------------
Faudra que je teste un jour :o
n°45255
the_fennec
f3nn3cUs z3rd4
Posté le 15-08-2026 à 10:15:56  profilanswer
 

On dirait que j'ai le même soucis, little-coder est intervenu:
https://i.imgur.com/rkANkJU.png
 
ya un bug dans llama.cpp en plus:
https://www.reddit.com/r/LocalLLaMA [...] d_to_chat/


Message édité par the_fennec le 15-08-2026 à 10:21:23

---------------
Faudra que je teste un jour :o
n°45256
yohaskan
Posté le 15-08-2026 à 10:33:10  profilanswer
 

the_fennec a écrit :

Si tu parles bien de Qwen 3.8, tu peux régler le thinking sur low, medium et xhigh (default).
 

Code :
  1. --chat-template-kwargs '{"reasoning_effort":"low"}'



 
Il y est, mais LM studio s'en bat les steacks des parametres reasoning_effort et enable_thinking en low / false
 

Code :
  1. 2026-08-15 10:17:42 [DEBUG]
  2. Received request: POST to /v1/chat/completions with body  {
  3.   "model": "qwen3.8-27b",
  4.   "messages": [
  5.     {
  6.       "role": "system",
  7.       "content": "Tu es un assistant. Réponds en une phrase courte, sans réfléchir longuement."
  8.     },
  9.     {
  10.       "role": "user",
  11.       "content": "Dis-moi bonjour en une phrase."
  12.     }
  13.   ],
  14.   "temperature": 0.7,
  15.   "max_tokens": 300,
  16.   "extra_body": {
  17.     "chat_template_kwargs": {
  18.       "enable_thinking": false,
  19.       "reasoning_effort": "low"
  20.     }
  21.   },
  22.   "reasoning_effort": "low"
  23. }
  24. 2026-08-15 10:17:42  [WARN]
  25. [lmstudio-community/qwen3.8-27b] Reasoning setting 'low' is not supported by model 'lmstudio-community/Qwen3.8-27B-GGUF/Qwen3.8-27B-Q4_K_M.gguf'. Supported settings: 'on', 'off'. Falling back to reasoning setting 'on'.


 
ou via lms log stream :  

Code :
  1. modelPath: lmstudio-community/Qwen3.8-27B-GGUF/Qwen3.8-27B-Q4_K_M.gguf
  2. input:
  3. <|im_start|>system
  4. Reasoning effort is set to xhigh. Please think carefully through the task, validate key assumptions, consider plausible alternatives, and prioritize correctness, consistency, and clarity in the final answer.
  5. Tu es un assistant. Réponds en une phrase courte, sans réfléchir longuement.<|im_end|>
  6. <|im_start|>user
  7. Dis-moi bonjour en une phrase.<|im_end|>
  8. <|im_start|>assistant
  9. <think>


 
J'ia essayé avec le llm d'Unsloth, et le nouveau GGUF de Lm studio (identique à celui de Qwen, je suppose)
https://huggingface.co/lmstudio-com [...] 8-27B-GGUF

Message cité 1 fois
Message édité par yohaskan le 15-08-2026 à 10:37:56
n°45257
the_fennec
f3nn3cUs z3rd4
Posté le 15-08-2026 à 10:44:19  profilanswer
 

D'ailleurs les settings recommandés ont changé:

Code :
  1. ::Thinking Mode: temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0
  2. ::Instruct (or non-thinking) mode: temperature=0.7, top_p=0.80, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0


 
Je suis encore en temperature 0.6


---------------
Faudra que je teste un jour :o
n°45258
M300A
Posté le 15-08-2026 à 10:50:45  profilanswer
 

yohaskan a écrit :

 

Il y est, mais LM studio s'en bat les steacks des parametres reasoning_effort et enable_thinking en low / false

 
Code :
  1. 2026-08-15 10:17:42 [DEBUG]
  2. Received request: POST to /v1/chat/completions with body  {
  3.   "model": "qwen3.8-27b",
  4.   "messages": [
  5.     {
  6.       "role": "system",
  7.       "content": "Tu es un assistant. Réponds en une phrase courte, sans réfléchir longuement."
  8.     },
  9.     {
  10.       "role": "user",
  11.       "content": "Dis-moi bonjour en une phrase."
  12.     }
  13.   ],
  14.   "temperature": 0.7,
  15.   "max_tokens": 300,
  16.   "extra_body": {
  17.     "chat_template_kwargs": {
  18.       "enable_thinking": false,
  19.       "reasoning_effort": "low"
  20.     }
  21.   },
  22.   "reasoning_effort": "low"
  23. }
  24. 2026-08-15 10:17:42  [WARN]
  25. [lmstudio-community/qwen3.8-27b] Reasoning setting 'low' is not supported by model 'lmstudio-community/Qwen3.8-27B-GGUF/Qwen3.8-27B-Q4_K_M.gguf'. Supported settings: 'on', 'off'. Falling back to reasoning setting 'on'.
 

ou via lms log stream :

Code :
  1. modelPath: lmstudio-community/Qwen3.8-27B-GGUF/Qwen3.8-27B-Q4_K_M.gguf
  2. input:
  3. <|im_start|>system
  4. Reasoning effort is set to xhigh. Please think carefully through the task, validate key assumptions, consider plausible alternatives, and prioritize correctness, consistency, and clarity in the final answer.
  5. Tu es un assistant. Réponds en une phrase courte, sans réfléchir longuement.<|im_end|>
  6. <|im_start|>user
  7. Dis-moi bonjour en une phrase.<|im_end|>
  8. <|im_start|>assistant
  9. <think>
 

J'ia essayé avec le llm d'Unsloth, et le nouveau GGUF de Lm studio (identique à celui de Qwen, je suppose)
https://huggingface.co/lmstudio-com [...] 8-27B-GGUF

 

J'imagine que le moteur est pas à jour, ou la template Jinja... Je sais que c'est tentant mais attends un peu que tout ça soit supporté correctement ;)


---------------
:wq
n°45259
yohaskan
Posté le 15-08-2026 à 11:05:56  profilanswer
 

Oui j'avais lu ça,  
Un peu étrange que la temp soit plus basse en mode instruct, mais bon s'il a été entraîné comme ça...
 
mais je doute que ca change quoi que ce soit pour la désactivation de son raisonnement ou gestion de son effort.
 
Donc ouais faut attendre un fix.
C'est chiant ces lancement foireux (Muse n'etait pas mieux), mais en même temps ca a un coté Wild Wild West ces LLM ; on est des pionniers ;)


Message édité par yohaskan le 15-08-2026 à 11:13:01
n°45260
the_fennec
f3nn3cUs z3rd4
Posté le 15-08-2026 à 11:18:31  profilanswer
 

Le soucis est déjà fixé dans llama.cpp:
https://github.com/ggml-org/llama.c [...] 446bd5460a
 
:o


---------------
Faudra que je teste un jour :o
n°45264
Pipould's
Posté le 15-08-2026 à 11:43:13  profilanswer
 

Team VLLM vous etes ou ? ^^
 
Y'a pas a dire VLLM et leur technique de prefill en meme temps que generation c'est un cran a dessus de llamacpp...

n°45267
neo world
Posté le 15-08-2026 à 11:59:22  profilanswer
 

Faut une grappe de GPU pour que ce soit intéressant de passer à vllm non ?
 
Dans les tests que j’ai vu en mono gpu llama sortait un peu plus de tokens / seconde

n°45269
Plam
Bear Metal
Posté le 15-08-2026 à 12:27:46  profilanswer
 

vLLM team ici, même si en mono GPU, avec pas mal de concurrence (et pas qu'une usage perso sur un seul GPU), ça tourne très bien :jap:


---------------
Spécialiste du bear metal
n°45270
Pipould's
Posté le 15-08-2026 à 12:28:30  profilanswer
 

neo world a écrit :

Faut une grappe de GPU pour que ce soit intéressant de passer à vllm non ?
 
Dans les tests que j’ai vu en mono gpu llama sortait un peu plus de tokens / seconde


 
En sequentiel pur oui, mais des que tu touches a du claude code ou autre t'as forcement des concurrences

n°45281
M300A
Posté le 15-08-2026 à 13:28:52  profilanswer
 

Pipould's a écrit :

Team VLLM vous etes ou ? ^^

 

Y'a pas a dire VLLM et leur technique de prefill en meme temps que generation c'est un cran a dessus de llamacpp...

 

Bah DS4 Flash 0731, si un jour on reçoit 4 RTX6K en plus j'envisagerais un GLM voir un Kimi mais pour le moment je pense que je vais  rien changer avant un moment.


---------------
:wq
n°45287
yohaskan
Posté le 15-08-2026 à 15:23:20  profilanswer
 

Bon j'ai retenté Qwen3.8 27B pour faire le Starfox-like, mais ce coup ci via Cline VScode , pour lui signaler les bugs
Prompt :  
Create a spaceship game inspired by Star Fox using vanilla Three.js and HTML. It should have at least five levels, keyboard and mouse controls, enemies, and a fully functional gameplay system.
 
14:27 Thinking en masse...
14.41: 1er gabarit html vide, sections J1 à J10
14:44 fin codage j1 à J4
14:47 fin codage j5 à J10
14:47 verification du code JS
14:49 I found a real bug: inside mouseToWorld()
14H50 Completed (d'après qwen...)
 
Je lance : ok j'ai un beau menu scintillant, je lance la partie... je vois le vaisseau et l'espace qui défile... pendant 3 seconde max, avant freeze total
 

Code :
  1. Oui, j'ai bien lu ton message — et __j'ai trouvé le bug exact__. Voici le diagnostic complet :
  2. ## Diagnostic du freeze (≈ 3 s après le lancement)
  3. __Cause racine — ligne 346 de `index.html` :__ dans `makeEnemy()`, l'objet ennemi `e` est créé __sans jamais lui assigner son groupe Three.js__ :
  4. ```js
  5. const e={type,t:rand(0,6),hp:1,...};   // ← pas de propriété "group" !
  6. ...
  7. g.position.set(x,y,z);scene.add(g);enemies.push(e);return e;  // g est orphelin
  8. ```


15h07 : Completed
 
 Corrections appliquées et validées (e.group=g présent exactement 1 fois, node --check OK) :
 

Code :
  1. # Fix Ligne
  2. 1 e.group=g; ajouté dans makeEnemy() ← la cause du freeze 346
  3. 2 Particules : plus de dispose de la géométrie partagée (fuite GPU) 469
  4. 3 Filet de sécurité : toute erreur JS future s'affiche en bandeau rouge en bas à la place d'un freeze silencieux CSS + HTML + JS
  5. Teste maintenant : recharge la page, lance la partie. Tu devrais voir les drones apparaître après ~3 s, te poursuivre, et être détruisibles au tir. Si un problème persiste, le bandeau rouge en bas de l'écran t'affichera directement le message d'erreur — dis-moi ce qu'il dit et je corrige.


- Ca marche, j'ai sauvé le Royaume de Corneria  :o  
 
Le "jeu" est ici :  
https://starfaux.pagedrop.io/


Message édité par yohaskan le 15-08-2026 à 15:45:11
n°45311
moyen_moin​s
chat réincarné
Posté le 15-08-2026 à 18:05:42  profilanswer
 

bon, qwen 3.8, pour le moment, obligé de désactiver le mode thinking car à part me bouffer mon contexte (limité), c'est inutilisable sinon.
et le machin d'unsloth là  [:ograoum papas:1]

n°45312
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 15-08-2026 à 18:34:16  profilanswer
 

Impossible de faire fonctionner correctement la repartition avec unsloth desktop, a chaque fois il me met des couches cpu et ca descend a 7 tok/s :O
 
Quand les bc250 sont de nouveaux libre je me rabat dessus avec llama.cpp :D


---------------
Victime de girafophobie, mais se soigne.
n°45317
neo world
Posté le 15-08-2026 à 19:29:11  profilanswer
 

pas de problème ici avec LM Studio et un MAC 48GB :jap:

n°45318
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 15-08-2026 à 19:35:35  profilanswer
 

C'est pas du tout les mêmes config aussi  :D

 

Une 3060+5070ti


---------------
Victime de girafophobie, mais se soigne.
n°45320
the_fennec
f3nn3cUs z3rd4
Posté le 15-08-2026 à 19:41:39  profilanswer
 

Tout marche bien chez moi avec llama.cpp
 
 
Qwen 3.8 27B first tests - 16GB Local LLM setup
Luke's Dev Lab
https://www.youtube.com/watch?v=1EzVVj7DFPc
 
TL;DR: pretty impressed


---------------
Faudra que je teste un jour :o
n°45323
Plam
Bear Metal
Posté le 15-08-2026 à 20:11:57  profilanswer
 

ça marche ici avec vLLM, en effet le thinking en xhigh par défaut ça fait du token :D


---------------
Spécialiste du bear metal
n°45324
the_fennec
f3nn3cUs z3rd4
Posté le 15-08-2026 à 20:22:11  profilanswer
 

Sans surprise 35B devrait suivre ensuite:
https://www.reddit.com/r/LocalLLaMA [...] b_spotted/


---------------
Faudra que je teste un jour :o
n°45325
neo world
Posté le 15-08-2026 à 20:43:45  profilanswer
 

C'est pas idéal mais le raport qualité prix est quand même présent (bordel c'est un Mac pourtant) :
https://www.dealabs.com/bons-plans/ [...] ub-3393465
 
410GB/s de bande passante mémoire

n°45326
neo world
Posté le 15-08-2026 à 20:48:01  profilanswer
 

Qwen 3.8 :

Citation :

Actually, let me be mindful of the token budget


 
Also Qwen 3.8 :
https://rehost.diberie.com/Picture/Get/f/536425
 
La question (un peu ouverte certes) faisait 84 token avec le skill idea refine chargé  :whistle:

n°45342
Pipould's
Posté le 16-08-2026 à 08:39:37  profilanswer
 

neo world a écrit :

Qwen 3.8 :

Citation :

Actually, let me be mindful of the token budget


 
Also Qwen 3.8 :
https://rehost.diberie.com/Picture/Get/f/536425
 
La question (un peu ouverte certes) faisait 84 token avec le skill idea refine chargé  :whistle:


 
tu es sur quel harness la ?  

n°45346
neo world
Posté le 16-08-2026 à 09:01:14  profilanswer
 

Le module chat LM studio avec un MCP d’accès à internet / recherche web.  
À noter que la question ne demandait à developper aucune ligne de code mais poussait à lire des papiers scientifiques :jap:

n°45356
yohaskan
Posté le 16-08-2026 à 10:38:52  profilanswer
 

Les attentes pour les LLM de code étant différentes de celles des LLM d’instruction utilisés en temps réel (type chat), ce point vous intéressera peut-être moins.  
Mais la latence induite par le raisonnement n’est pas toujours utile, et le problème devient de plus en plus visible avec les modèles qui raisonnent de plus en plus longtemps.
 
J’ai fait un petit test avec Qwen3.8 27B, en comparant le mode thinking ON/OFF — pour l’instant le seul paramètre exploitable avec ce modèle, en attendant le correctif du bug côté Llama soit propagé aux autres runetime (LM Studio/vLLM) .
 
Sur une même série de cas :
thinking ON : raisonnement poussé au maximum (xhigh) ;
thinking OFF : réponse directe.
 
Le résultat est assez clair : thinking OFF est meilleur sur les deux axes :
Précision : 91 % vs 82 %
Latence : 0,60 s vs 4,11 s, soit environ 7× plus rapide.
 
Et certains cas sont particulièrement révélateurs.
 
Le cas calculate est probablement le plus parlant : avec thinking ON, le modèle consomme ses 1400 tokens de raisonnement et passe environ 22 secondes à réfléchir… sans jamais appeler l’outil. Avec thinking OFF, il fait également le mauvais choix (search_wiki au lieu de calculate), mais en 0,5 s. Le problème vient donc probablement davantage du prompt que d'un manque de raisonnement — mais le thinking transforme une petite erreur en énorme pénalité de latence.
 
Autre cas intéressant : pour search_wiki vs analyze_screen, le mode ON suit de manière très rigide la règle « regarde → analyze_screen() », alors que le mode OFF comprend mieux le contexte et choisit search_wiki. Le raisonnement maximal n'améliore donc pas nécessairement la compréhension : il peut aussi pousser le modèle à sur-appliquer certaines règles du prompt.
 
C'est finalement le point intéressant du test : plus de raisonnement ne signifie pas forcément de meilleures décisions, surtout lorsque la tâche demande avant tout une réponse rapide et une bonne interprétation du contexte.
 
 

Code :
  1. ======================================================================
  2. CAS : 'Triss, ça va ?'
  3. Attendu : conversation   (cas simple)
  4. ======================================================================
  5.   [on (xhigh)] essai 1/3 : ✅ sélectionné='conversation'  latence=2.25s  reasoning_tokens=85
  6.   [on (xhigh)] essai 2/3 : ✅ sélectionné='conversation'  latence=1.19s  reasoning_tokens=65
  7.   [on (xhigh)] essai 3/3 : ✅ sélectionné='conversation'  latence=1.32s  reasoning_tokens=70
  8.   [off (none)] essai 1/3 : ✅ sélectionné='conversation'  latence=0.84s  reasoning_tokens=0
  9.   [off (none)] essai 2/3 : ✅ sélectionné='conversation'  latence=0.31s  reasoning_tokens=0
  10.   [off (none)] essai 3/3 : ✅ sélectionné='conversation'  latence=0.29s  reasoning_tokens=0
  11. ======================================================================
  12. CAS : 'Triss regarde mon écran'
  13. Attendu : analyze_screen   (cas simple)
  14. ======================================================================
  15.   [on (xhigh)] essai 1/3 : ✅ sélectionné='analyze_screen'  latence=1.68s  reasoning_tokens=69
  16.   [on (xhigh)] essai 2/3 : ✅ sélectionné='analyze_screen'  latence=1.92s  reasoning_tokens=94
  17.   [on (xhigh)] essai 3/3 : ✅ sélectionné='analyze_screen'  latence=1.55s  reasoning_tokens=80
  18.   [off (none)] essai 1/3 : ✅ sélectionné='analyze_screen'  latence=0.98s  reasoning_tokens=0
  19.   [off (none)] essai 2/3 : ✅ sélectionné='analyze_screen'  latence=0.26s  reasoning_tokens=0
  20.   [off (none)] essai 3/3 : ✅ sélectionné='analyze_screen'  latence=0.23s  reasoning_tokens=0
  21. ======================================================================
  22. CAS : "Qu'est-ce qui s'est passé ces 5 dernières minutes ?"
  23. Attendu : analyze_visual_memory   (cas simple)
  24. ======================================================================
  25.   [on (xhigh)] essai 1/3 : ✅ sélectionné='analyze_visual_memory'  latence=1.98s  reasoning_tokens=66
  26.   [on (xhigh)] essai 2/3 : ✅ sélectionné='analyze_visual_memory'  latence=1.84s  reasoning_tokens=105
  27.   [on (xhigh)] essai 3/3 : ✅ sélectionné='analyze_visual_memory'  latence=1.63s  reasoning_tokens=86
  28.   [off (none)] essai 1/3 : ✅ sélectionné='analyze_visual_memory'  latence=0.99s  reasoning_tokens=0
  29.   [off (none)] essai 2/3 : ✅ sélectionné='analyze_visual_memory'  latence=0.26s  reasoning_tokens=0
  30.   [off (none)] essai 3/3 : ✅ sélectionné='analyze_visual_memory'  latence=0.25s  reasoning_tokens=0
  31. ======================================================================
  32. CAS : 'Mémorise que la base est au nord du lac'
  33. Attendu : store_memory   (cas simple)
  34. ======================================================================
  35.   [on (xhigh)] essai 1/3 : ✅ sélectionné='store_memory'  latence=3.89s  reasoning_tokens=148
  36.   [on (xhigh)] essai 2/3 : ✅ sélectionné='store_memory'  latence=3.9s  reasoning_tokens=216
  37.   [on (xhigh)] essai 3/3 : ✅ sélectionné='store_memory'  latence=3.33s  reasoning_tokens=150
  38.   [off (none)] essai 1/3 : ✅ sélectionné='store_memory'  latence=1.68s  reasoning_tokens=0
  39.   [off (none)] essai 2/3 : ✅ sélectionné='store_memory'  latence=0.84s  reasoning_tokens=0
  40.   [off (none)] essai 3/3 : ✅ sélectionné='store_memory'  latence=0.84s  reasoning_tokens=0
  41. ======================================================================
  42. CAS : "Tu te souviens de la route bleue qu'on avait notée ?"
  43. Attendu : search_memory   (cas simple)
  44. ======================================================================
  45.   [on (xhigh)] essai 1/3 : ✅ sélectionné='search_memory'  latence=2.44s  reasoning_tokens=77
  46.   [on (xhigh)] essai 2/3 : ✅ sélectionné='search_memory'  latence=2.33s  reasoning_tokens=121
  47.   [on (xhigh)] essai 3/3 : ✅ sélectionné='search_memory'  latence=1.56s  reasoning_tokens=87
  48.   [off (none)] essai 1/3 : ✅ sélectionné='search_memory'  latence=1.1s  reasoning_tokens=0
  49.   [off (none)] essai 2/3 : ✅ sélectionné='search_memory'  latence=0.36s  reasoning_tokens=0
  50.   [off (none)] essai 3/3 : ✅ sélectionné='search_memory'  latence=0.34s  reasoning_tokens=0
  51. ======================================================================
  52. CAS : 'Fais-moi un résumé de la dernière session'
  53. Attendu : get_session_summary   (cas simple)
  54. ======================================================================
  55.   [on (xhigh)] essai 1/3 : ✅ sélectionné='get_session_summary'  latence=1.97s  reasoning_tokens=61
  56.   [on (xhigh)] essai 2/3 : ✅ sélectionné='get_session_summary'  latence=1.61s  reasoning_tokens=91
  57.   [on (xhigh)] essai 3/3 : ✅ sélectionné='get_session_summary'  latence=1.43s  reasoning_tokens=74
  58.   [off (none)] essai 1/3 : ✅ sélectionné='get_session_summary'  latence=0.98s  reasoning_tokens=0
  59.   [off (none)] essai 2/3 : ✅ sélectionné='get_session_summary'  latence=0.24s  reasoning_tokens=0
  60.   [off (none)] essai 3/3 : ✅ sélectionné='get_session_summary'  latence=0.24s  reasoning_tokens=0
  61. ======================================================================
  62. CAS : "J'ai 12 clous et 8 planches, combien de barricades je peux poser ?"
  63. Attendu : calculate   (cas simple)
  64. ======================================================================
  65.   [on (xhigh)] essai 1/3 : ❌ sélectionné='search_wiki'  latence=20.23s  reasoning_tokens=1156
  66.   [on (xhigh)] essai 2/3 : ❌ sélectionné=None  latence=22.47s  reasoning_tokens=1400
  67.   [on (xhigh)] essai 3/3 : ❌ sélectionné=None  latence=22.89s  reasoning_tokens=1400
  68.   [off (none)] essai 1/3 : ❌ sélectionné='search_wiki'  latence=0.92s  reasoning_tokens=0
  69.   [off (none)] essai 2/3 : ❌ sélectionné='search_wiki'  latence=0.52s  reasoning_tokens=0
  70.   [off (none)] essai 3/3 : ❌ sélectionné='search_wiki'  latence=0.5s  reasoning_tokens=0
  71. ======================================================================
  72. CAS : "Putain ce zombie m'a eu par derrière..."
  73. Attendu : silence   (monologue, pas de nom)
  74. ======================================================================
  75.   [on (xhigh)] essai 1/3 : ✅ sélectionné='silence'  latence=3.18s  reasoning_tokens=93
  76.   [on (xhigh)] essai 2/3 : ✅ sélectionné='silence'  latence=2.04s  reasoning_tokens=115
  77.   [on (xhigh)] essai 3/3 : ✅ sélectionné='silence'  latence=3.06s  reasoning_tokens=167
  78.   [off (none)] essai 1/3 : ✅ sélectionné='silence'  latence=1.33s  reasoning_tokens=0
  79.   [off (none)] essai 2/3 : ✅ sélectionné='silence'  latence=0.57s  reasoning_tokens=0
  80.   [off (none)] essai 3/3 : ✅ sélectionné='silence'  latence=0.56s  reasoning_tokens=0
  81. ======================================================================
  82. CAS : 'Bon, je vais rouler un peu et je vais regarder mes informations concernant le personnage.'
  83. Attendu : analyze_screen   (AMBIGU — échec en prod (dialogue-PZ-03))
  84. ======================================================================
  85.   [on (xhigh)] essai 1/3 : ✅ sélectionné='analyze_screen'  latence=2.61s  reasoning_tokens=78
  86.   [on (xhigh)] essai 2/3 : ✅ sélectionné='analyze_screen'  latence=3.19s  reasoning_tokens=182
  87.   [on (xhigh)] essai 3/3 : ✅ sélectionné='analyze_screen'  latence=2.0s  reasoning_tokens=122
  88.   [off (none)] essai 1/3 : ✅ sélectionné='analyze_screen'  latence=0.64s  reasoning_tokens=0
  89.   [off (none)] essai 2/3 : ✅ sélectionné='analyze_screen'  latence=0.31s  reasoning_tokens=0
  90.   [off (none)] essai 3/3 : ✅ sélectionné='analyze_screen'  latence=0.27s  reasoning_tokens=0
  91. ======================================================================
  92. CAS : 'Triss, Réponds-moi.'
  93. Attendu : conversation   (AMBIGU — échec en prod (dialogue-PZ-03))
  94. ======================================================================
  95.   [on (xhigh)] essai 1/3 : ✅ sélectionné='conversation'  latence=2.33s  reasoning_tokens=78
  96.   [on (xhigh)] essai 2/3 : ✅ sélectionné='conversation'  latence=1.96s  reasoning_tokens=106
  97.   [on (xhigh)] essai 3/3 : ✅ sélectionné='conversation'  latence=1.57s  reasoning_tokens=75
  98.   [off (none)] essai 1/3 : ✅ sélectionné='conversation'  latence=0.6s  reasoning_tokens=0
  99.   [off (none)] essai 2/3 : ✅ sélectionné='conversation'  latence=0.28s  reasoning_tokens=0
  100.   [off (none)] essai 3/3 : ✅ sélectionné='conversation'  latence=0.27s  reasoning_tokens=0
  101. ======================================================================
  102. CAS : 'Regarde sur le wiki comment soigner une infection'
  103. Attendu : search_wiki   (AMBIGU — conflit règle 'regarde' vs 'wiki')
  104. ======================================================================
  105.   [on (xhigh)] essai 1/3 : ❌ sélectionné='analyze_screen'  latence=4.11s  reasoning_tokens=205
  106.   [on (xhigh)] essai 2/3 : ❌ sélectionné='analyze_screen'  latence=3.54s  reasoning_tokens=205
  107.   [on (xhigh)] essai 3/3 : ❌ sélectionné='analyze_screen'  latence=2.77s  reasoning_tokens=169
  108.   [off (none)] essai 1/3 : ✅ sélectionné='search_wiki'  latence=1.11s  reasoning_tokens=0
  109.   [off (none)] essai 2/3 : ✅ sélectionné='search_wiki'  latence=0.4s  reasoning_tokens=0
  110.   [off (none)] essai 3/3 : ✅ sélectionné='search_wiki'  latence=0.38s  reasoning_tokens=0
  111. ######################################################################
  112. RÉSUMÉ
  113. ######################################################################
  114. thinking ON (xhigh) (33 appels) :
  115.   précision       : 82%
  116.   latence moyenne : 4.11s
  117.   reasoning_tokens moyen : 221
  118. thinking OFF (none) (33 appels) :
  119.   précision       : 91%
  120.   latence moyenne : 0.60s
  121.   reasoning_tokens moyen : 0

Message cité 2 fois
Message édité par yohaskan le 16-08-2026 à 11:31:27
n°45361
Pipould's
Posté le 16-08-2026 à 11:40:55  profilanswer
 

yohaskan a écrit :

Les attentes pour les LLM de code étant différentes de celles des LLM d’instruction utilisés en temps réel (type chat), ce point vous intéressera peut-être moins.  
Mais la latence induite par le raisonnement n’est pas toujours utile, et le problème devient de plus en plus visible avec les modèles qui raisonnent de plus en plus longtemps.
 
J’ai fait un petit test avec Qwen3.8 27B, en comparant le mode thinking ON/OFF — pour l’instant le seul paramètre exploitable avec ce modèle, en attendant le correctif du bug côté Llama soit propagé aux autres runetime (LM Studio/vLLM) .
 
Sur une même série de cas :
thinking ON : raisonnement poussé au maximum (xhigh) ;
thinking OFF : réponse directe.
 
Le résultat est assez clair : thinking OFF est meilleur sur les deux axes :
Précision : 91 % vs 82 %
Latence : 0,60 s vs 4,11 s, soit environ 7× plus rapide.
 
Et certains cas sont particulièrement révélateurs.
 
Le cas calculate est probablement le plus parlant : avec thinking ON, le modèle consomme ses 1400 tokens de raisonnement et passe environ 22 secondes à réfléchir… sans jamais appeler l’outil. Avec thinking OFF, il fait également le mauvais choix (search_wiki au lieu de calculate), mais en 0,5 s. Le problème vient donc probablement davantage du prompt que d'un manque de raisonnement — mais le thinking transforme une petite erreur en énorme pénalité de latence.
 
Autre cas intéressant : pour search_wiki vs analyze_screen, le mode ON suit de manière très rigide la règle « regarde → analyze_screen() », alors que le mode OFF comprend mieux le contexte et choisit search_wiki. Le raisonnement maximal n'améliore donc pas nécessairement la compréhension : il peut aussi pousser le modèle à sur-appliquer certaines règles du prompt.
 
C'est finalement le point intéressant du test : plus de raisonnement ne signifie pas forcément de meilleures décisions, surtout lorsque la tâche demande avant tout une réponse rapide et une bonne interprétation du contexte.
 
 

Code :
  1. ======================================================================
  2. CAS : 'Triss, ça va ?'
  3. Attendu : conversation   (cas simple)
  4. ======================================================================
  5.   [on (xhigh)] essai 1/3 : ✅ sélectionné='conversation'  latence=2.25s  reasoning_tokens=85
  6.   [on (xhigh)] essai 2/3 : ✅ sélectionné='conversation'  latence=1.19s  reasoning_tokens=65
  7.   [on (xhigh)] essai 3/3 : ✅ sélectionné='conversation'  latence=1.32s  reasoning_tokens=70
  8.   [off (none)] essai 1/3 : ✅ sélectionné='conversation'  latence=0.84s  reasoning_tokens=0
  9.   [off (none)] essai 2/3 : ✅ sélectionné='conversation'  latence=0.31s  reasoning_tokens=0
  10.   [off (none)] essai 3/3 : ✅ sélectionné='conversation'  latence=0.29s  reasoning_tokens=0
  11. ======================================================================
  12. CAS : 'Triss regarde mon écran'
  13. Attendu : analyze_screen   (cas simple)
  14. ======================================================================
  15.   [on (xhigh)] essai 1/3 : ✅ sélectionné='analyze_screen'  latence=1.68s  reasoning_tokens=69
  16.   [on (xhigh)] essai 2/3 : ✅ sélectionné='analyze_screen'  latence=1.92s  reasoning_tokens=94
  17.   [on (xhigh)] essai 3/3 : ✅ sélectionné='analyze_screen'  latence=1.55s  reasoning_tokens=80
  18.   [off (none)] essai 1/3 : ✅ sélectionné='analyze_screen'  latence=0.98s  reasoning_tokens=0
  19.   [off (none)] essai 2/3 : ✅ sélectionné='analyze_screen'  latence=0.26s  reasoning_tokens=0
  20.   [off (none)] essai 3/3 : ✅ sélectionné='analyze_screen'  latence=0.23s  reasoning_tokens=0
  21. ======================================================================
  22. CAS : "Qu'est-ce qui s'est passé ces 5 dernières minutes ?"
  23. Attendu : analyze_visual_memory   (cas simple)
  24. ======================================================================
  25.   [on (xhigh)] essai 1/3 : ✅ sélectionné='analyze_visual_memory'  latence=1.98s  reasoning_tokens=66
  26.   [on (xhigh)] essai 2/3 : ✅ sélectionné='analyze_visual_memory'  latence=1.84s  reasoning_tokens=105
  27.   [on (xhigh)] essai 3/3 : ✅ sélectionné='analyze_visual_memory'  latence=1.63s  reasoning_tokens=86
  28.   [off (none)] essai 1/3 : ✅ sélectionné='analyze_visual_memory'  latence=0.99s  reasoning_tokens=0
  29.   [off (none)] essai 2/3 : ✅ sélectionné='analyze_visual_memory'  latence=0.26s  reasoning_tokens=0
  30.   [off (none)] essai 3/3 : ✅ sélectionné='analyze_visual_memory'  latence=0.25s  reasoning_tokens=0
  31. ======================================================================
  32. CAS : 'Mémorise que la base est au nord du lac'
  33. Attendu : store_memory   (cas simple)
  34. ======================================================================
  35.   [on (xhigh)] essai 1/3 : ✅ sélectionné='store_memory'  latence=3.89s  reasoning_tokens=148
  36.   [on (xhigh)] essai 2/3 : ✅ sélectionné='store_memory'  latence=3.9s  reasoning_tokens=216
  37.   [on (xhigh)] essai 3/3 : ✅ sélectionné='store_memory'  latence=3.33s  reasoning_tokens=150
  38.   [off (none)] essai 1/3 : ✅ sélectionné='store_memory'  latence=1.68s  reasoning_tokens=0
  39.   [off (none)] essai 2/3 : ✅ sélectionné='store_memory'  latence=0.84s  reasoning_tokens=0
  40.   [off (none)] essai 3/3 : ✅ sélectionné='store_memory'  latence=0.84s  reasoning_tokens=0
  41. ======================================================================
  42. CAS : "Tu te souviens de la route bleue qu'on avait notée ?"
  43. Attendu : search_memory   (cas simple)
  44. ======================================================================
  45.   [on (xhigh)] essai 1/3 : ✅ sélectionné='search_memory'  latence=2.44s  reasoning_tokens=77
  46.   [on (xhigh)] essai 2/3 : ✅ sélectionné='search_memory'  latence=2.33s  reasoning_tokens=121
  47.   [on (xhigh)] essai 3/3 : ✅ sélectionné='search_memory'  latence=1.56s  reasoning_tokens=87
  48.   [off (none)] essai 1/3 : ✅ sélectionné='search_memory'  latence=1.1s  reasoning_tokens=0
  49.   [off (none)] essai 2/3 : ✅ sélectionné='search_memory'  latence=0.36s  reasoning_tokens=0
  50.   [off (none)] essai 3/3 : ✅ sélectionné='search_memory'  latence=0.34s  reasoning_tokens=0
  51. ======================================================================
  52. CAS : 'Fais-moi un résumé de la dernière session'
  53. Attendu : get_session_summary   (cas simple)
  54. ======================================================================
  55.   [on (xhigh)] essai 1/3 : ✅ sélectionné='get_session_summary'  latence=1.97s  reasoning_tokens=61
  56.   [on (xhigh)] essai 2/3 : ✅ sélectionné='get_session_summary'  latence=1.61s  reasoning_tokens=91
  57.   [on (xhigh)] essai 3/3 : ✅ sélectionné='get_session_summary'  latence=1.43s  reasoning_tokens=74
  58.   [off (none)] essai 1/3 : ✅ sélectionné='get_session_summary'  latence=0.98s  reasoning_tokens=0
  59.   [off (none)] essai 2/3 : ✅ sélectionné='get_session_summary'  latence=0.24s  reasoning_tokens=0
  60.   [off (none)] essai 3/3 : ✅ sélectionné='get_session_summary'  latence=0.24s  reasoning_tokens=0
  61. ======================================================================
  62. CAS : "J'ai 12 clous et 8 planches, combien de barricades je peux poser ?"
  63. Attendu : calculate   (cas simple)
  64. ======================================================================
  65.   [on (xhigh)] essai 1/3 : ❌ sélectionné='search_wiki'  latence=20.23s  reasoning_tokens=1156
  66.   [on (xhigh)] essai 2/3 : ❌ sélectionné=None  latence=22.47s  reasoning_tokens=1400
  67.   [on (xhigh)] essai 3/3 : ❌ sélectionné=None  latence=22.89s  reasoning_tokens=1400
  68.   [off (none)] essai 1/3 : ❌ sélectionné='search_wiki'  latence=0.92s  reasoning_tokens=0
  69.   [off (none)] essai 2/3 : ❌ sélectionné='search_wiki'  latence=0.52s  reasoning_tokens=0
  70.   [off (none)] essai 3/3 : ❌ sélectionné='search_wiki'  latence=0.5s  reasoning_tokens=0
  71. ======================================================================
  72. CAS : "Putain ce zombie m'a eu par derrière..."
  73. Attendu : silence   (monologue, pas de nom)
  74. ======================================================================
  75.   [on (xhigh)] essai 1/3 : ✅ sélectionné='silence'  latence=3.18s  reasoning_tokens=93
  76.   [on (xhigh)] essai 2/3 : ✅ sélectionné='silence'  latence=2.04s  reasoning_tokens=115
  77.   [on (xhigh)] essai 3/3 : ✅ sélectionné='silence'  latence=3.06s  reasoning_tokens=167
  78.   [off (none)] essai 1/3 : ✅ sélectionné='silence'  latence=1.33s  reasoning_tokens=0
  79.   [off (none)] essai 2/3 : ✅ sélectionné='silence'  latence=0.57s  reasoning_tokens=0
  80.   [off (none)] essai 3/3 : ✅ sélectionné='silence'  latence=0.56s  reasoning_tokens=0
  81. ======================================================================
  82. CAS : 'Bon, je vais rouler un peu et je vais regarder mes informations concernant le personnage.'
  83. Attendu : analyze_screen   (AMBIGU — échec en prod (dialogue-PZ-03))
  84. ======================================================================
  85.   [on (xhigh)] essai 1/3 : ✅ sélectionné='analyze_screen'  latence=2.61s  reasoning_tokens=78
  86.   [on (xhigh)] essai 2/3 : ✅ sélectionné='analyze_screen'  latence=3.19s  reasoning_tokens=182
  87.   [on (xhigh)] essai 3/3 : ✅ sélectionné='analyze_screen'  latence=2.0s  reasoning_tokens=122
  88.   [off (none)] essai 1/3 : ✅ sélectionné='analyze_screen'  latence=0.64s  reasoning_tokens=0
  89.   [off (none)] essai 2/3 : ✅ sélectionné='analyze_screen'  latence=0.31s  reasoning_tokens=0
  90.   [off (none)] essai 3/3 : ✅ sélectionné='analyze_screen'  latence=0.27s  reasoning_tokens=0
  91. ======================================================================
  92. CAS : 'Triss, Réponds-moi.'
  93. Attendu : conversation   (AMBIGU — échec en prod (dialogue-PZ-03))
  94. ======================================================================
  95.   [on (xhigh)] essai 1/3 : ✅ sélectionné='conversation'  latence=2.33s  reasoning_tokens=78
  96.   [on (xhigh)] essai 2/3 : ✅ sélectionné='conversation'  latence=1.96s  reasoning_tokens=106
  97.   [on (xhigh)] essai 3/3 : ✅ sélectionné='conversation'  latence=1.57s  reasoning_tokens=75
  98.   [off (none)] essai 1/3 : ✅ sélectionné='conversation'  latence=0.6s  reasoning_tokens=0
  99.   [off (none)] essai 2/3 : ✅ sélectionné='conversation'  latence=0.28s  reasoning_tokens=0
  100.   [off (none)] essai 3/3 : ✅ sélectionné='conversation'  latence=0.27s  reasoning_tokens=0
  101. ======================================================================
  102. CAS : 'Regarde sur le wiki comment soigner une infection'
  103. Attendu : search_wiki   (AMBIGU — conflit règle 'regarde' vs 'wiki')
  104. ======================================================================
  105.   [on (xhigh)] essai 1/3 : ❌ sélectionné='analyze_screen'  latence=4.11s  reasoning_tokens=205
  106.   [on (xhigh)] essai 2/3 : ❌ sélectionné='analyze_screen'  latence=3.54s  reasoning_tokens=205
  107.   [on (xhigh)] essai 3/3 : ❌ sélectionné='analyze_screen'  latence=2.77s  reasoning_tokens=169
  108.   [off (none)] essai 1/3 : ✅ sélectionné='search_wiki'  latence=1.11s  reasoning_tokens=0
  109.   [off (none)] essai 2/3 : ✅ sélectionné='search_wiki'  latence=0.4s  reasoning_tokens=0
  110.   [off (none)] essai 3/3 : ✅ sélectionné='search_wiki'  latence=0.38s  reasoning_tokens=0
  111. ######################################################################
  112. RÉSUMÉ
  113. ######################################################################
  114. thinking ON (xhigh) (33 appels) :
  115.   précision       : 82%
  116.   latence moyenne : 4.11s
  117.   reasoning_tokens moyen : 221
  118. thinking OFF (none) (33 appels) :
  119.   précision       : 91%
  120.   latence moyenne : 0.60s
  121.   reasoning_tokens moyen : 0



 
Du coup dans quels cas de figure vois tu un avantage a avoir un raisonement ?  

 Page :   1  2  3  4  5  ..  36  37  38  ..  68  69  70  71  72  73

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)