Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
2847 connectés 

 


Je génère ...
Sondage à 3 choix possibles.
Ce sondage expirera le 20-09-2026 à 10:00




Attention si vous cliquez sur "voir les résultats" vous ne pourrez plus voter

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  12  13  14  ..  65  66  67  68  69  70
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°38220
TotalRecal​l
Posté le 08-06-2026 à 14:23:00  profilanswer
 

Reprise du message précédent :
Une vidéo très critique envers le nVidia RTX spark : https://www.youtube.com/watch?v=9t0g7awe4lc

 

Le mec doit avoir une dent contre nvidia parce qu'il les vanne tout au long de la vidéo mais il fait des critiques intéressantes je trouve à la fois sur l'architecture technique (cpu off the shelf MediaTek au lieu d'une solution dédiée, limitations de la LPDDR5 par rapport à la GDDR7 d'un dGPU, gpu blackwell, etc) et logicielle (absolument rien de nouveau dans ce qui est proposé et pas du tout axé consommateur / grand public, malgré le slogan moisi de révolutionner le pc, etc) pour un prix excessif.
En gros pour ce prix c'est un loupé qui fait moins bien que des trucs plus vieux et moins cher, tout en n'apportant rien sur le côté software / mise à la portée du grand public.

Message cité 3 fois
Message édité par TotalRecall le 08-06-2026 à 14:24:13

---------------
Topic .Net - C# @ Prog
n°38227
morcok
Posté le 08-06-2026 à 14:47:36  profilanswer
 

Salut, j'ai une 3060 12go et c'est bien plus pratique que 8go, je suis étonné de ne pas la voir dans la liste des gpu conseillés, c'est un oubli ou il y a une raison ?

n°38232
the_fennec
f3nn3cUs z3rd4
Posté le 08-06-2026 à 15:15:30  profilanswer
 

croustx a écrit :

J'ai une 3090 (donc 24go de Vram)
 
Modèle installé via Ollama.
Puis récupéré dans VS code.


 
Tu peux essayer les nouveaux Gemma QAT:
https://huggingface.co/unsloth/gemma-4-31B-it-qat-GGUF
https://huggingface.co/unsloth/gemm [...] t-qat-GGUF
 
Même si je préfère Qwen 3.6, ça va passer un peu juste avec UD-Q4_K_S:
https://huggingface.co/unsloth/Qwen3.6-35B-A3B-GGUF
 
Sinon 27B en Q4_K_M:
https://huggingface.co/unsloth/Qwen3.6-27B-GGUF
 
Llama.cpp est plus a jour et sobre que Ollama si tu peux. Essaye un contexte de 32k voir 64k en q8_0-q5_1.
 
Par exemple pour Qwen 3.6 avec un modèle que sera vu comme default:

Code :
  1. llama-server --no-mmap --flash-attn on -lv 4 --alias default --host 0.0.0.0 --port 8080 --jinja -m modele.gguf -ctk q8_0 -ctv q5_1 --ctx-size 65536 --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 --repeat-penalty 1.0 --presence-penalty 0.0


---------------
Faudra que je teste un jour :o
n°38234
the_fennec
f3nn3cUs z3rd4
Posté le 08-06-2026 à 15:35:33  profilanswer
 

morcok a écrit :

Salut, j'ai une 3060 12go et c'est bien plus pratique que 8go, je suis étonné de ne pas la voir dans la liste des gpu conseillés, c'est un oubli ou il y a une raison ?


 
Salut,
Difficile de recommander quoi que ce soit vu les prix :o


---------------
Faudra que je teste un jour :o
n°38238
neo world
Posté le 08-06-2026 à 15:44:32  profilanswer
 

croustx a écrit :

J'ai une 3090 (donc 24go de Vram)
 
Modèle installé via Ollama.
Puis récupéré dans VS code.


the_fennec a raison, prends un modèle plus récent (Qwen3.6) :jap: Si tu fais ça en mode hobby je te conseil aussi lm studio qui est vraiment pratique pour aller chercher des modèles adaptés à ton hardware et qui permet de tester vite bien :)
 
notes qu'ajouter des system prompts (skills) aide aussi beaucoup à améliorer les réponses :D (attention le modèle hallucinera quand même :o)

n°38240
neo world
Posté le 08-06-2026 à 15:50:01  profilanswer
 

morcok a écrit :

Salut, j'ai une 3060 12go et c'est bien plus pratique que 8go, je suis étonné de ne pas la voir dans la liste des gpu conseillés, c'est un oubli ou il y a une raison ?


C'est un peu cul entre deux chaises : un peu de VRAM pour plus de cache et cuda c'est très bien mais tu peux trouver des AMD radeons moins chers avec 16GO :jap:

n°38242
neo world
Posté le 08-06-2026 à 15:55:35  profilanswer
 

TotalRecall a écrit :

Une vidéo très critique envers le nVidia RTX spark : https://www.youtube.com/watch?v=9t0g7awe4lc
 
Le mec doit avoir une dent contre nvidia parce qu'il les vanne tout au long de la vidéo mais il fait des critiques intéressantes je trouve à la fois sur l'architecture technique (cpu off the shelf MediaTek au lieu d'une solution dédiée, limitations de la LPDDR5 par rapport à la GDDR7 d'un dGPU, gpu blackwell, etc) et logicielle (absolument rien de nouveau dans ce qui est proposé et pas du tout axé consommateur / grand public, malgré le slogan moisi de révolutionner le pc, etc) pour un prix excessif.  
En gros pour ce prix c'est un loupé qui fait moins bien que des trucs plus vieux et moins cher, tout en n'apportant rien sur le côté software / mise à la portée du grand public.


C'est intéressant comme critique. Pour le moment (combien de temps ?) ce sera imbattable avec l'AMD strix Halo : rien ne permet d'avoir autant de VRAM pour un prix (quasiment) accessible et si effectivement je préfère l'option GDDR pour les modèles il semble que pour le CPU c'est vraiment pas idéal (latences très élevées). En dehors des consoles et du bc250 j'ai rien vu qui unifie la mémoire CPU et GPU sur de la GDDR (beaucoup plus chère que la LPDDR aussi d'ailleurs)
 
On pas prêt de faire tourner les gros modèles sur du hardware accessible avant encore un long moment (même si il y a des initiatives genre tiiny mais qui semble controversé) :jap:

n°38245
TotalRecal​l
Posté le 08-06-2026 à 16:07:13  profilanswer
 

BC250 le prix est top, mais entre l'avenir logiciel un peu incertain, la construction très particulière et la conso en idle qui semble un peu délirante j'ai passé mon tour, ça doit être sympa pour bidouiller mais pour un usage de prod j'ai des doutes.

Message cité 1 fois
Message édité par TotalRecall le 08-06-2026 à 16:07:29

---------------
Topic .Net - C# @ Prog
n°38247
lapin
Posté le 08-06-2026 à 16:07:45  profilanswer
 

neo world a écrit :


C'est intéressant comme critique. Pour le moment (combien de temps ?) ce sera imbattable avec l'AMD strix Halo : rien ne permet d'avoir autant de VRAM pour un prix (quasiment) accessible et si effectivement je préfère l'option GDDR pour les modèles il semble que pour le CPU c'est vraiment pas idéal (latences très élevées). En dehors des consoles et du bc250 j'ai rien vu qui unifie la mémoire CPU et GPU sur de la GDDR (beaucoup plus chère que la LPDDR aussi d'ailleurs)
 
On pas prêt de faire tourner les gros modèles sur du hardware accessible avant encore un long moment (même si il y a des initiatives genre tiiny mais qui semble controversé) :jap:


 
 
Après peut-être que Google va soit licencier voir mettre en open source sa technologie TurboQuant.
du coup moins besoin de mémoire vive tant dans les datacenters que dans les modèles d'IA en local sur du GPU.

n°38250
LibreArbit​re
La /root est longue
Posté le 08-06-2026 à 16:14:22  profilanswer
 

Jules Winnfield a écrit :

https://www.dealabs.com/bons-plans/ [...] ux-3347472
 
Je partage simplement, je ne sais pas si c'est intéressant :D


Merci, ça faisait longtemps que j'en cherchais une à bon prix :love:
 
Encore merci :jap:


---------------
Pharyo | Cinépite | Capvirage
n°38252
fabien44
Posté le 08-06-2026 à 16:27:33  profilanswer
 

drap

n°38253
Pipould's
Posté le 08-06-2026 à 16:31:20  profilanswer
 

TotalRecall a écrit :

Une vidéo très critique envers le nVidia RTX spark : https://www.youtube.com/watch?v=9t0g7awe4lc
 
Le mec doit avoir une dent contre nvidia parce qu'il les vanne tout au long de la vidéo mais il fait des critiques intéressantes je trouve à la fois sur l'architecture technique (cpu off the shelf MediaTek au lieu d'une solution dédiée, limitations de la LPDDR5 par rapport à la GDDR7 d'un dGPU, gpu blackwell, etc) et logicielle (absolument rien de nouveau dans ce qui est proposé et pas du tout axé consommateur / grand public, malgré le slogan moisi de révolutionner le pc, etc) pour un prix excessif.  
En gros pour ce prix c'est un loupé qui fait moins bien que des trucs plus vieux et moins cher, tout en n'apportant rien sur le côté software / mise à la portée du grand public.


 
Pour donner un exemple...
 
J'ai un strix. En gros plus: C'est un PC.  
 
En gros moins: vitesse de prefil pas dingue. agentic ai super galere, ca prend des plombes a remonter un context.
 
Du coup j'ai monte un pc dual 3090 pour mes setup de "prod".
 
Les 128GB unifies c'est tres bien si tu veux tester un modele, ou en entrainer un.  
 
Mais un mec qui aura un B6000 te diras toujours que c'est de la merde. et des que tu as 3 x 3090 ou 2 x PRO9700, le UC de 128GB de ram unifiee n'a plus forcement de sens.
 
Car oui tu peux charger un model de 100GB de ram dans un strix / gb10, mais honnetement ca tourne tellement lentement...

n°38254
the_fennec
f3nn3cUs z3rd4
Posté le 08-06-2026 à 16:34:34  profilanswer
 

TotalRecall a écrit :

BC250 le prix est top, mais entre l'avenir logiciel un peu incertain, la construction très particulière et la conso en idle qui semble un peu délirante j'ai passé mon tour, ça doit être sympa pour bidouiller mais pour un usage de prod j'ai des doutes.


 
C'est clairement de la bidouille, faut pas partir avec autre chose en tête. Perso j'en ai prix une deuxième car la CM de mon serveur c'est une simple MSI B450 Gaming Max et que si j'ajoute une deuxième carte pcie tout passe en 1x et qu'il faudrait que je change mon alim en plus. Donc je m'y retrouve.
Le cadeau bonux, c'est de pouvoir en faire une Steam machine quand j'aurais mieux.
 
 

lapin a écrit :

Après peut-être que Google va soit licencier voir mettre en open source sa technologie TurboQuant.
du coup moins besoin de mémoire vive tant dans les datacenters que dans les modèles d'IA en local sur du GPU.


 
TQ de Google c'est de la daube, voir mon post un peu plus haut. C'est même un peu la honte pour Google de sortir un papier comme ça, c'est a se demander si c'est pas vibe-codé :o


---------------
Faudra que je teste un jour :o
n°38255
LibreArbit​re
La /root est longue
Posté le 08-06-2026 à 16:39:06  profilanswer
 
n°38256
Pipould's
Posté le 08-06-2026 à 16:40:51  profilanswer
 


 
Je pense pas, comme a l'epoque des CG bridees par le bios... Par contre c'est pas dit que tes 40 CU fonctionnent pour le coup...

n°38257
the_fennec
f3nn3cUs z3rd4
Posté le 08-06-2026 à 16:46:36  profilanswer
 

TotalRecall a écrit :

Une vidéo très critique envers le nVidia RTX spark : https://www.youtube.com/watch?v=9t0g7awe4lc
 
Le mec doit avoir une dent contre nvidia parce qu'il les vanne tout au long de la vidéo mais il fait des critiques intéressantes je trouve à la fois sur l'architecture technique (cpu off the shelf MediaTek au lieu d'une solution dédiée, limitations de la LPDDR5 par rapport à la GDDR7 d'un dGPU, gpu blackwell, etc) et logicielle (absolument rien de nouveau dans ce qui est proposé et pas du tout axé consommateur / grand public, malgré le slogan moisi de révolutionner le pc, etc) pour un prix excessif.  
En gros pour ce prix c'est un loupé qui fait moins bien que des trucs plus vieux et moins cher, tout en n'apportant rien sur le côté software / mise à la portée du grand public.


 

Pipould's a écrit :


 
Pour donner un exemple...
 
J'ai un strix. En gros plus: C'est un PC.  
 
En gros moins: vitesse de prefil pas dingue. agentic ai super galere, ca prend des plombes a remonter un context.
 
Du coup j'ai monte un pc dual 3090 pour mes setup de "prod".
 
Les 128GB unifies c'est tres bien si tu veux tester un modele, ou en entrainer un.  
 
Mais un mec qui aura un B6000 te diras toujours que c'est de la merde. et des que tu as 3 x 3090 ou 2 x PRO9700, le UC de 128GB de ram unifiee n'a plus forcement de sens.
 
Car oui tu peux charger un model de 100GB de ram dans un strix / gb10, mais honnetement ca tourne tellement lentement...


 
Même si sa vidéo est assez aggressive, et son ton très désagréable je pense qu'il n'a pas tors. Je rejoins ce que tu dis Pipould's.
 
Au final c'est une 5070 avec 128Go de DDR5, ça fait pas rêver surtout avec un CPU en carton. Je vois pas trop comment un modèle dense de 100GB pourrait tourner la dessus a une vitesse satisfaisante.


---------------
Faudra que je teste un jour :o
n°38258
the_fennec
f3nn3cUs z3rd4
Posté le 08-06-2026 à 16:48:00  profilanswer
 


 
Non, pas mal de retours que ça marche, j'ai pas testé pour le moment, peut être ce WE si j'ai pas la flemme.
 
Ya aussi des rumeurs qu'il est possible de réactiver les deux core CPU manquants.


---------------
Faudra que je teste un jour :o
n°38259
the_fennec
f3nn3cUs z3rd4
Posté le 08-06-2026 à 16:49:05  profilanswer
 

Pipould's a écrit :


 
Je pense pas, comme a l'epoque des CG bridees par le bios... Par contre c'est pas dit que tes 40 CU fonctionnent pour le coup...


 
Ya un script fournis pour tester et aussi un bench llama avec!


---------------
Faudra que je teste un jour :o
n°38262
Pipould's
Posté le 08-06-2026 à 17:17:39  profilanswer
 

the_fennec a écrit :


 
Non, pas mal de retours que ça marche, j'ai pas testé pour le moment, peut être ce WE si j'ai pas la flemme.
 
Ya aussi des rumeurs qu'il est possible de réactiver les deux core CPU manquants.


 

the_fennec a écrit :


 
Ya un script fournis pour tester et aussi un bench llama avec!


 
Etes-vous surs que tout cela est reactivable ? Ou ont-ils etes desactives car non fonctionnels ? C'est ca le truc... C'est un peu comme jouer au loto...

n°38263
Pipould's
Posté le 08-06-2026 à 17:21:16  profilanswer
 

the_fennec a écrit :


 
Même si sa vidéo est assez aggressive, et son ton très désagréable je pense qu'il n'a pas tors. Je rejoins ce que tu dis Pipould's.
 
Au final c'est une 5070 avec 128Go de DDR5, ça fait pas rêver surtout avec un CPU en carton. Je vois pas trop comment un modèle dense de 100GB pourrait tourner la dessus a une vitesse satisfaisante.


 
En fait le strix marche bien pour moi pour du nanobot...
 
1. T'as pas besoin de reponse immediate
2. T'as besoin de pas mal de sessions en //
 
 
Mais la tu parles d'un usage applicatif de PoC pour monter de la start-up
 
Si tu veux un usage d'aide au developement, il faut quelque chose de plus rapide...

n°38264
neo world
Posté le 08-06-2026 à 17:22:01  profilanswer
 

c'est exactement un loto mais les rejets se font sur plein d'autres critères (fuite électrique / conso trop importante, mauvaise tenue de la fréquence max ... ) Pas pour rien qu'ils en ont tant en stock :D

n°38270
the_fennec
f3nn3cUs z3rd4
Posté le 08-06-2026 à 17:50:08  profilanswer
 

Pipould's a écrit :

Etes-vous surs que tout cela est reactivable ? Ou ont-ils etes desactives car non fonctionnels ? C'est ca le truc... C'est un peu comme jouer au loto...


Non, aucune garantie, c'est le jeu :o
A la base ce sont des cartes de minage déclassée, faites a partir d'APU de PS5 déclassés ...
 
 

Pipould's a écrit :


 
En fait le strix marche bien pour moi pour du nanobot...
 
1. T'as pas besoin de reponse immediate
2. T'as besoin de pas mal de sessions en //
 
 
Mais la tu parles d'un usage applicatif de PoC pour monter de la start-up
 
Si tu veux un usage d'aide au developement, il faut quelque chose de plus rapide...


 
Ce sont des laptops, mis en face des Macbook pro, pour pas laisser la place a Apple. (Et pareil pour les Mac Studio vs Strix ou DGX).
 
Donc c'est pas pour de la prod, on est d'accord, mais je suis pas convaincu par le combos Windows/Mediatek pour concurrencer les MBP.


---------------
Faudra que je teste un jour :o
n°38276
TotalRecal​l
Posté le 08-06-2026 à 19:25:57  profilanswer
 

Un avis sur gemma-4-26b-a4b-qat (sorti il y a quelques jours) ?  
 
Je suis en train de le tester sur de la génération de code (python, powershell, html5...), je trouve le résultat très convaincant pour un petit modèle (15Go seul, donc ça rentre quasiment sans offloading dans une CG grand public).
Jusque là j'étais plus Qwen mais celui là me plaît bien !


---------------
Topic .Net - C# @ Prog
n°38291
the_fennec
f3nn3cUs z3rd4
Posté le 08-06-2026 à 20:34:16  profilanswer
 

Pas trop convaincu par mes tests rapides, je trouve qu'il fini toujours par merder sur les executions de tools et la génération de code. Après je compare avec Qwen3.6 3B Q6 ou 27B Q8, donc c'est pas équitable. Si on a que 16GB de VRAM, je pense que QAT est une bonne option.


Message édité par the_fennec le 08-06-2026 à 20:34:42

---------------
Faudra que je teste un jour :o
n°38296
Pipould's
Posté le 08-06-2026 à 20:41:53  profilanswer
 

the_fennec a écrit :


Non, aucune garantie, c'est le jeu :o
A la base ce sont des cartes de minage déclassée, faites a partir d'APU de PS5 déclassés ...
 
 


 

the_fennec a écrit :


 
Ce sont des laptops, mis en face des Macbook pro, pour pas laisser la place a Apple. (Et pareil pour les Mac Studio vs Strix ou DGX).
 
Donc c'est pas pour de la prod, on est d'accord, mais je suis pas convaincu par le combos Windows/Mediatek pour concurrencer les MBP.


 
C'est la raison qui m'a fait prendre un Strix au lieu d'un DGX... Je me suis dit qu'au pire ca fera une super steam machine...

n°38306
LibreArbit​re
La /root est longue
Posté le 08-06-2026 à 21:04:45  profilanswer
 

Je ne savais pas que c'étaient des cartes qui avaient servi à miner... Du coup leur durée de vie est aléatoire vu qu'elles ont dû tourner à 100% en 24/7 pendant des années...


---------------
Pharyo | Cinépite | Capvirage
n°38331
Olivie
SUUUUUUUUUUUUUU
Posté le 09-06-2026 à 07:34:54  profilanswer
 

Citation :

@bastiengares
C’est l’innovation la plus marquante d’Apple. Au lieu de forcer tout le modèle dans la DRAM, l’AFM 3 Core Advanced stocke le modèle complet en mémoire flash (NAND).  Comme la bande passante NAND -> DRAM est trop lente pour échanger les poids token par token (ce qu’exigent les MoE classiques), le modèle prend ses décisions de routage par prompt plutôt qu’en continu. Cette approche repose sur l’Instruction-Following Pruning (IFP) une technique développée par les chercheurs d’Apple
 
https://pbs.twimg.com/media/HKUfwEwWUAAlyTQ?format=jpg&name=900x900


 
https://machinelearning.apple.com/r [...] ion-models


---------------

n°38334
the_fennec
f3nn3cUs z3rd4
Posté le 09-06-2026 à 07:47:31  profilanswer
 

LibreArbitre a écrit :

Je ne savais pas que c'étaient des cartes qui avaient servi à miner... Du coup leur durée de vie est aléatoire vu qu'elles ont dû tourner à 100% en 24/7 pendant des années...

 

Paradoxalement je pense que c'est bien plus fiable qu'un gpu d'occase qui a connu des pics de chauffe et des reboots etc. Ce sont des cartes pro. Probablement uv dans des racks climatisés, tension stable, peu d'allumages, charge stable.

 

Après ça reste de l'occase avec des APUs déclassé, donc il ya un risque. Pour autant les problèmes que j'ai vu c'est le le bios ou la sort sortie vidéo qui est capricieuse.


---------------
Faudra que je teste un jour :o
n°38344
speedboyz3​0
Guide Michelin :o
Posté le 09-06-2026 à 09:15:37  profilanswer
 

Bon bah pas de nouveau mac studio :o

n°38358
the_fennec
f3nn3cUs z3rd4
Posté le 09-06-2026 à 11:24:40  profilanswer
 

Ça faisait un moment que je trouvais mes agents beaucoup moins bons, au bout de deux lignes ils oubliaient le prompt de base et partaient un peu en sucette.  
J'ai trouvé le coupable:

Code :
  1. --chat-template-kwargs "{\"preserve_thinking\": true}"


 
C'est pourtant recommandé, enfin c'est comme ça je l'ai compris. Ça mets le thinking dans le contexte et améliore le cache... ou pas. En fait pour moi ça pourrit le contexte. Tout le thinking du modèle écrase complètement le contexte et l'agent part très facilement en boucle ou oublie les instructions. Dis comme ça, c'est évident, mais j'ai mis une bonne semaine a comprendre.
 
Autre trouvaille, avec des env vars pour forcer la taille de contexte, j'ai claude qui tourne en local sans soucis :love:, voila ma config:
 
~/.claude/settings.json

Code :
  1. {
  2.   "env": {
  3.     "ANTHROPIC_MODEL": "default",
  4.     "CLAUDE_CODE_ENABLE_TELEMETRY": "0",
  5.     "CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1",
  6.     "CLAUDE_CODE_DISABLE_1M_CONTEXT": "1",
  7.     "CLAUDE_CODE_MAX_OUTPUT_TOKENS": "64000",
  8.     "DISABLE_COST_WARNINGS": "1",
  9.     "CLAUDE_CODE_AUTO_COMPACT_WINDOW": "65000",
  10.     "CLAUDE_AUTOCOMPACT_PCT_OVERRIDE": "90",
  11.     "DISABLE_PROMPT_CACHING": "1",
  12.     "CLAUDE_CODE_DISABLE_EXPERIMENTAL_BETAS": "1",
  13.     "CLAUDE_CODE_DISABLE_ADAPTIVE_THINKING": "1",
  14.     "DISABLE_INTERLEAVED_THINKING": "1",
  15.     "CLAUDE_CODE_MAX_RETRIES": "3",
  16.     "CLAUDE_CODE_DISABLE_FEEDBACK_SURVEY": "1",
  17.     "CLAUDE_CODE_ATTRIBUTION_HEADER": "0"
  18.   },
  19.   "attribution": {
  20.     "commit": "",
  21.     "pr": ""
  22.   },
  23.   "permissions": {
  24.     "allow": [
  25.       "Bash(git *)",
  26.       "Bash(ls *)"
  27.     ],
  28.     "defaultMode": "dontAsk"
  29.   },
  30.   "effortLevel": "high",
  31.   "promptSuggestionEnabled": false,
  32.   "plansDirectory": "./plans",
  33.   "prefersReducedMotion": true,
  34.   "skipDangerousModePermissionPrompt": true,
  35.   "terminalProgressBarEnabled": false
  36. }


 
https://i.imgur.com/fNrfmtN.png
 
Bon je suis près pour l'arrivée de ma deuxième BC250 :o


---------------
Faudra que je teste un jour :o
n°38364
ibuprophet
Posté le 09-06-2026 à 12:07:03  profilanswer
 

perso j'ai fait coder à claude un proxy pour remplacer Haiku par mon qwen3.6. Ca marche même dans l'extension vscode et j'ai toujours accès à Sonnet et Opus

n°38371
Pipould's
Posté le 09-06-2026 à 13:07:00  profilanswer
 

the_fennec a écrit :

Ça faisait un moment que je trouvais mes agents beaucoup moins bons, au bout de deux lignes ils oubliaient le prompt de base et partaient un peu en sucette.
J'ai trouvé le coupable:

Code :
  1. --chat-template-kwargs "{\"preserve_thinking\": true}"
 

C'est pourtant recommandé, enfin c'est comme ça je l'ai compris. Ça mets le thinking dans le contexte et améliore le cache... ou pas. En fait pour moi ça pourrit le contexte. Tout le thinking du modèle écrase complètement le contexte et l'agent part très facilement en boucle ou oublie les instructions. Dis comme ça, c'est évident, mais j'ai mis une bonne semaine a comprendre.

 

Autre trouvaille, avec des env vars pour forcer la taille de contexte, j'ai claude qui tourne en local sans soucis :love:, voila ma config:

 

~/.claude/settings.json

Code :
  1. {
  2.   "env": {
  3.     "ANTHROPIC_MODEL": "default",
  4.     "CLAUDE_CODE_ENABLE_TELEMETRY": "0",
  5.     "CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1",
  6.     "CLAUDE_CODE_DISABLE_1M_CONTEXT": "1",
  7.     "CLAUDE_CODE_MAX_OUTPUT_TOKENS": "64000",
  8.     "DISABLE_COST_WARNINGS": "1",
  9.     "CLAUDE_CODE_AUTO_COMPACT_WINDOW": "65000",
  10.     "CLAUDE_AUTOCOMPACT_PCT_OVERRIDE": "90",
  11.     "DISABLE_PROMPT_CACHING": "1",
  12.     "CLAUDE_CODE_DISABLE_EXPERIMENTAL_BETAS": "1",
  13.     "CLAUDE_CODE_DISABLE_ADAPTIVE_THINKING": "1",
  14.     "DISABLE_INTERLEAVED_THINKING": "1",
  15.     "CLAUDE_CODE_MAX_RETRIES": "3",
  16.     "CLAUDE_CODE_DISABLE_FEEDBACK_SURVEY": "1",
  17.     "CLAUDE_CODE_ATTRIBUTION_HEADER": "0"
  18.   },
  19.   "attribution": {
  20.     "commit": "",
  21.     "pr": ""
  22.   },
  23.   "permissions": {
  24.     "allow": [
  25.       "Bash(git *)",
  26.       "Bash(ls *)"
  27.     ],
  28.     "defaultMode": "dontAsk"
  29.   },
  30.   "effortLevel": "high",
  31.   "promptSuggestionEnabled": false,
  32.   "plansDirectory": "./plans",
  33.   "prefersReducedMotion": true,
  34.   "skipDangerousModePermissionPrompt": true,
  35.   "terminalProgressBarEnabled": false
  36. }
 

https://i.imgur.com/fNrfmtN.png

 

Bon je suis près pour l'arrivée de ma deuxième BC250 :o

 


Tu as quoi comme infra pour faire tourner Claude avec du LLM local ? J'ai trouvé que ça bouffait un max de ressources... Et du coup j'utilise cline.

n°38377
the_fennec
f3nn3cUs z3rd4
Posté le 09-06-2026 à 14:06:50  profilanswer
 

ibuprophet a écrit :

perso j'ai fait coder à claude un proxy pour remplacer Haiku par mon qwen3.6. Ca marche même dans l'extension vscode et j'ai toujours accès à Sonnet et Opus


Pour l'instant j'ai pas encore choisi mon outil, donc la flemme de faire coder un truc. Mais la je suis content de claude pour le moment.
 
 

Pipould's a écrit :

Tu as quoi comme infra pour faire tourner Claude avec du LLM local ? J'ai trouvé que ça bouffait un max de ressources... Et du coup j'utilise cline.


llama.cpp + 4060Ti 16GB + BC250 16GB coté inférence, une petite VM Debian (6GB, 4 vCPU) pour claude, le il prends dans les 500MB de RAM.


---------------
Faudra que je teste un jour :o
n°38378
totosssfr
Pousse-testa
Posté le 09-06-2026 à 14:07:09  profilanswer
 

Bonjour à tous, je plante mon drapeau.
Je n'ai vu personne avec le même matos que moi : un vieux hp z4 g4 acheté sur ebay + une intel arc b60 24 go neuve.
Pour l'instant ollama tourne sur le gpu et ça ne va pas très vite.
Selon les modèles, on est entre 15 et 25 tg/s.

 

C'est un bon début pour commencer à jouer.
@+


---------------
Pousse tarasse forever.
n°38379
the_fennec
f3nn3cUs z3rd4
Posté le 09-06-2026 à 14:10:52  profilanswer
 

Salut,
 
J'étais bien intéressé par les Arc. Tu as quoi comme OS/modèle?
Tu en fais quoi?
 
:hello:


---------------
Faudra que je teste un jour :o
n°38390
totosssfr
Pousse-testa
Posté le 09-06-2026 à 14:59:59  profilanswer
 

Salut,  
L'OS est une ubuntu server 24.04 lts avec un kernel 6.17.
Le kernel 6.8 livré avec ubuntu 24.04 ne supporte pas la B60.
La machine est entièrement dédiée au llm.
Mon objectif :  
- développement assisté par IA C# et ASP.Net sous vs code /visual studio pro.
- développer des applis utilisant les capacités IA pour aider les commerciaux à créer des devis de manière semi automatique à partir de photos.
 
Si c'est efficace, j'investirai dans une seconde arc B60 afin d'atteindre 48 Go en local et je commencerai à négocier pour obtenir une machine de ce genre (plus musclée et sous nvidia) dans ma cogip.
 
J'étais initialement parti sur une arc B70 pro ou une R9700 pour les 32 Go de VRAM mais le Z4 G4 est limité par son alim 750w: j'aurai été limité à une seule carte. J'ai préféré partir sur une seule B60 (conso raisonnable) en espérant en prendre une seconde plus tard. Le budget d'une seule R9700 paie les deux B60.

n°38410
speedboyz3​0
Guide Michelin :o
Posté le 09-06-2026 à 15:36:49  profilanswer
 

Intéressant :jap:

n°38411
Pipould's
Posté le 09-06-2026 à 15:43:49  profilanswer
 

the_fennec a écrit :


llama.cpp + 4060Ti 16GB + BC250 16GB coté inférence, une petite VM Debian (6GB, 4 vCPU) pour claude, le il prends dans les 500MB de RAM.


 
Tu split la charge comment entre la 4060Ti et la BC250 ? llama rpc ? pool d'agents independants ?  

n°38413
Pipould's
Posté le 09-06-2026 à 15:51:22  profilanswer
 

totosssfr a écrit :

Salut,  
L'OS est une ubuntu server 24.04 lts avec un kernel 6.17.
Le kernel 6.8 livré avec ubuntu 24.04 ne supporte pas la B60.
La machine est entièrement dédiée au llm.
Mon objectif :  
- développement assisté par IA C# et ASP.Net sous vs code /visual studio pro.
- développer des applis utilisant les capacités IA pour aider les commerciaux à créer des devis de manière semi automatique à partir de photos.
 
Si c'est efficace, j'investirai dans une seconde arc B60 afin d'atteindre 48 Go en local et je commencerai à négocier pour obtenir une machine de ce genre (plus musclée et sous nvidia) dans ma cogip.
 
J'étais initialement parti sur une arc B70 pro ou une R9700 pour les 32 Go de VRAM mais le Z4 G4 est limité par son alim 750w: j'aurai été limité à une seule carte. J'ai préféré partir sur une seule B60 (conso raisonnable) en espérant en prendre une seconde plus tard. Le budget d'une seule R9700 paie les deux B60.


 
Tu peux toujours swap l'alim.  
 
N'oublies pas que l'important est surtout la prefill speed pour ce qui est de l'agentic coding. Je ne sais pas quelles sont les perfs cote Intel.

n°38419
totosssfr
Pousse-testa
Posté le 09-06-2026 à 16:27:17  profilanswer
 

J'avais envisagé le swap d'alim mais c'est un format spécifique à ce modèle de machine et la version 1000w est hors de prix.
Pour les perfs, je suis toujours en phase de découverte.

 

Je m'étais fixé un budget de 2k€ max et même comme ça, ça fait cher l'objet uniquement pour m'amuser.

 

Je tiendrai au courant le topic de l'avancée du projet.


---------------
Pousse tarasse forever.
n°38462
the_fennec
f3nn3cUs z3rd4
Posté le 09-06-2026 à 20:23:41  profilanswer
 

totosssfr a écrit :

Salut,  
L'OS est une ubuntu server 24.04 lts avec un kernel 6.17.
Le kernel 6.8 livré avec ubuntu 24.04 ne supporte pas la B60.
La machine est entièrement dédiée au llm.
Mon objectif :  
- développement assisté par IA C# et ASP.Net sous vs code /visual studio pro.
- développer des applis utilisant les capacités IA pour aider les commerciaux à créer des devis de manière semi automatique à partir de photos.
 
Si c'est efficace, j'investirai dans une seconde arc B60 afin d'atteindre 48 Go en local et je commencerai à négocier pour obtenir une machine de ce genre (plus musclée et sous nvidia) dans ma cogip.
 
J'étais initialement parti sur une arc B70 pro ou une R9700 pour les 32 Go de VRAM mais le Z4 G4 est limité par son alim 750w: j'aurai été limité à une seule carte. J'ai préféré partir sur une seule B60 (conso raisonnable) en espérant en prendre une seconde plus tard. Le budget d'une seule R9700 paie les deux B60.


 
CPU?RAM?
quel models?
25 tg/s c'est pas beaucoup


---------------
Faudra que je teste un jour :o
 Page :   1  2  3  4  5  ..  12  13  14  ..  65  66  67  68  69  70

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)