Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
3214 connectés 

 


Je génère ...
Sondage à 3 choix possibles.
Ce sondage expirera le 20-09-2026 à 10:00




Attention si vous cliquez sur "voir les résultats" vous ne pourrez plus voter

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  56  57  58  59  60  61
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°48120
neo world
Posté le 07-09-2026 à 23:49:08  profilanswer
 

Reprise du message précédent :
Subtilité que j'ai oublié de préciser : j'ai mis le contexte natif max de 262k avec compactage à 93% de cette valeur et surtout je n'utilise pas le llama.cpp natif mais une version compilée en suivant les recommandations d'atomic chat pour le strix halo.
 
Aucune idée si ça aide ou si ça empire les perfs donc attention avant de suivre mon exemple :D

n°48121
the_fennec
f3nn3cUs z3rd4
Posté le 07-09-2026 à 23:56:48  profilanswer
 

Déjà tu as le MTP qui n'est toujours pas mergé il me semble
 
seulement 8k de reasoning?


---------------
Faudra que je teste un jour :o
n°48122
M300A
Posté le 07-09-2026 à 23:59:41  profilanswer
 

Bonsoir  [:garypresident:2]

 

https://img.super-h.fr/images/2026/09/07/31e809a32e01bcee34a5c449f4fb93f5.md.jpg

 

https://img.super-h.fr/images/2026/09/07/bc3641df73b7b5117794e45ee49d696d.md.jpg

 

https://img.super-h.fr/images/2026/09/07/627644908dacb7426d20f4d63eef6d87.md.jpg


---------------
:wq
n°48123
neo world
Posté le 08-09-2026 à 00:03:01  profilanswer
 

Dit donc y'a de la place non utilisée pour de la RAM le jour où les prix baisseront mais surtout un gros paquet de cartes supplémentaires :love:

Message cité 1 fois
Message édité par neo world le 08-09-2026 à 00:03:14
n°48124
neo world
Posté le 08-09-2026 à 00:04:28  profilanswer
 

the_fennec a écrit :

Déjà tu as le MTP qui n'est toujours pas mergé il me semble
 
seulement 8k de reasoning?


ouais c'est un peu mis au pif. Dans les faits je le vois très rarement sur une session qui a déjà plus de 8M de tokens :jap:

n°48126
neo world
Posté le 08-09-2026 à 00:32:24  profilanswer
 

pour ceux qui font du pi.dev et qui ont horreur du temps de sommeil / aiment bien savoir ce qu'il se passe :
https://codeberg.org/neoworld/audit [...] /README.md
 
https://forum.hardware.fr/forum2.ph [...] s=0#t48125

n°48128
M300A
Posté le 08-09-2026 à 01:01:07  profilanswer
 

neo world a écrit :

Dit donc y'a de la place non utilisée pour de la RAM le jour où les prix baisseront mais surtout un gros paquet de cartes supplémentaires :love:

 

On l'a justement ouvert entre autre pour rajouter 256Gb. Le prix des 4 barrettes d'occasion que j'avais dans les mains  :lol: c'est tellement ridicule


---------------
:wq
n°48130
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 08-09-2026 à 01:08:55  profilanswer
 

 

https://rehost.diberie.com/Picture/Get/r/542151

 

Ça se fait bien et le résultat est propre  :sol:


---------------
Victime de girafophobie, mais se soigne.
n°48131
neo world
Posté le 08-09-2026 à 01:11:15  profilanswer
 

belle grille de rasoirs pour un rasage de près en un passage ... faut pas se louper  [:mattt-osx]  :o
 

M300A a écrit :


 
On l'a justement ouvert entre autre pour rajouter 256Gb. Le prix des 4 barrettes d'occasion que j'avais dans les mains  :lol: c'est tellement ridicule


J'ai acheté 64GO il y a deux semaines. Madame était en mode  [:fl0odaj_progressiv:9]


Message édité par neo world le 08-09-2026 à 01:14:27
n°48133
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 08-09-2026 à 02:14:58  profilanswer
 

J'ai bien dit de mettre des gants  :O


---------------
Victime de girafophobie, mais se soigne.
n°48134
Pipould's
Posté le 08-09-2026 à 06:57:13  profilanswer
 

neo world a écrit :

Subtilité que j'ai oublié de préciser : j'ai mis le contexte natif max de 262k avec compactage à 93% de cette valeur et surtout je n'utilise pas le llama.cpp natif mais une version compilée en suivant les recommandations d'atomic chat pour le strix halo.

 

Aucune idée si ça aide ou si ça empire les perfs donc attention avant de suivre mon exemple :D

 

Je vois :)

 

Tu as quoi comme perfs a peut près ?

n°48135
Pipould's
Posté le 08-09-2026 à 07:03:16  profilanswer
 

Tronklou a écrit :

 

https://rehost.diberie.com/Picture/Get/r/542151

 

Ça se fait bien et le résultat est propre  :sol:


Tu gagnes vraiment en température a faire ça vs un fan duct bien fait ?

n°48137
Pipould's
Posté le 08-09-2026 à 07:11:07  profilanswer
 
n°48143
the_fennec
f3nn3cUs z3rd4
Posté le 08-09-2026 à 08:08:25  profilanswer
 
n°48144
neo world
Posté le 08-09-2026 à 08:10:29  profilanswer
 

Pipould's a écrit :


 
Je vois :)
 
Tu as quoi comme perfs a peut près ?


environ 250 tokens / seconde en PP et environ 18 tokens / seconde en generation.  
 
Très variable selon les requêtes ça peut rapidement tomber à 10 (j'imagine quand le MTP génère plus de déchets). Le plus gros handicape c'est le hardware est à ses limites : processer deux requêtes en parallèle fait tomber le TG/s à 7 par tête de pipe. le Atomic chat sortait 35 tokens / seconde dans les mêmes conditions. je pourrais augmenter le --spec-draft-n-max 4 (avec le bénéfice d'une meilleurs vitesse de token generation en pointe mais le risque de voir reculer d'avantage le tg / seconde en cas d'echec de predition par mtp)
 
Mais pour mon usage c'est correct. J'avais toujours envisagé une approche hybride de toute façon.

n°48158
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 08-09-2026 à 09:55:15  profilanswer
 

Pipould's a écrit :


Tu gagnes vraiment en température a faire ça vs un fan duct bien fait ?

 

10 degrés


---------------
Victime de girafophobie, mais se soigne.
n°48160
neo world
Posté le 08-09-2026 à 10:05:11  profilanswer
 

c'est grâce à la conductivité thermique légendaire du scotch de masquage jaune :whistle:
 

Spoiler :

vous allez voir que dans un an c'est que proposeront les IA à la question : "comment gagner 10° sur la température de mon CPU / GPU ?" :o


Message édité par neo world le 08-09-2026 à 10:06:36
n°48174
XaTriX
Posté le 08-09-2026 à 11:09:03  profilanswer
 
n°48190
Amonchakai
Posté le 08-09-2026 à 13:09:49  profilanswer
 

Je vois pas bien c'est quoi, c'est du ampere mais ça peut etre entre du A30 et A100 quoi :o
 
Edit: d'ailleurs je viens de découvrir l'existence de la A16, c'est pas mal ça  :love:
Edit2: Ah, en fait la A16 c'est 4GPU sur une carte. Il y a pas de miracle, c'est pour ça que c'est pas cher  :D


Message édité par Amonchakai le 08-09-2026 à 13:18:02
n°48191
moyen_moin​s
chat réincarné
Posté le 08-09-2026 à 13:16:24  profilanswer
 

moi qui attendais pour investir : https://www.amd.com/en/products/wor [...] ation.html
avec ça, j'suis bon pour une hypothèque :o


Message édité par moyen_moins le 08-09-2026 à 13:16:32
n°48194
Amonchakai
Posté le 08-09-2026 à 13:27:38  profilanswer
 

Et l'année prochaine ça vaudra 10 balles, si tu investi faut un ROI rapide assuré :o

n°48195
moyen_moin​s
chat réincarné
Posté le 08-09-2026 à 13:39:59  profilanswer
 

10 balles ? sauf éclatement de bulle :lol:
mais ils disent tous ce que c'est pas une bulle :ange:

n°48196
Amonchakai
Posté le 08-09-2026 à 13:44:41  profilanswer
 

J'exagère bien sur, mais du matos comme ça faut pas mettre trop de sous ou avoir une stratégie de ROI de prévu.

n°48197
moyen_moin​s
chat réincarné
Posté le 08-09-2026 à 13:55:41  profilanswer
 

c'était ironique, jamais je mets autant d'argent là dedans :o

n°48205
b-tzu
Geek a toute heure...
Posté le 08-09-2026 à 14:38:59  profilanswer
 

le monstre...
bon apres cest un pc fixe modulaire classique quoi. sauf avec des composants spécialisés ia.  
ca doit pouvoir se mettre chez soi non ?  
ou alors cest une config unique avec des composants a part et des standards concus spécifiquement ?


---------------
Topic Ventes || Topic Jeux Vidéos || Topic Téléphonie (Rien pour le moment)
n°48208
the_fennec
f3nn3cUs z3rd4
Posté le 08-09-2026 à 14:49:22  profilanswer
 

Bon, upgrade de mon Ryzen 5 3600 en 5650GE pour passer le GPU AMD sur la VM Windows et mettre la RTX4060Ti sous Debian.
Upgrade de BIOS au passage. Bordel ce stress les boots qui mettent 3 minutes avec un écran noir [:max evans]
 
Bon l'ESXi est repartis, ça marche. Mais quand je mets le passthrough du GPU AMD j'ai un gros freeze de l'ESXi entier. Je sens pas ça va pas être facile. Déjà que le passthrough NVidia c'était chaud :/ Donc pour le moment le llama.cpp est en pause, ça me fera des économies d'elec :o
 
A terme je voudrais passer sur Proxmox, mais je testerais ça quand j'aurais trouvé une petite CM AM4 ou LGA1200 apacher pour me faire la main.


---------------
Faudra que je teste un jour :o
n°48209
neo world
Posté le 08-09-2026 à 15:04:35  profilanswer
 

Si tu veux que je test une bricole sur proxmox en Gpu ou autre dis moi. Par contre ce sera du 780m. Pas super AI ready :o

n°48210
neo world
Posté le 08-09-2026 à 15:08:29  profilanswer
 

b-tzu a écrit :

le monstre...
bon apres cest un pc fixe modulaire classique quoi. sauf avec des composants spécialisés ia.  
ca doit pouvoir se mettre chez soi non ?  
ou alors cest une config unique avec des composants a part et des standards concus spécifiquement ?


les GPU installés dedans sont normalement dispos que pour des installations en rackable (ça doit pouvoir se retrouver en seconde main mais c'est un peu tôt encore comme c'est de génération "actuelle"
 
Ce sera probablement positionné comme la strix halo : cher mais moins que l'alternative equivalente en mieux de chez nvidia. Vous attendez à vous équiper avec si vous trouviez le strix halo trop cher pour ce que c'est :o

n°48212
the_fennec
f3nn3cUs z3rd4
Posté le 08-09-2026 à 15:11:31  profilanswer
 

neo world a écrit :

Si tu veux que je test une bricole sur proxmox en Gpu ou autre dis moi. Par contre ce sera du 780m. Pas super AI ready :o


 
C'est gentil :jap: mais c'est pour migrer mes VMs, trop la flemme de les refaire... j'ai même encore un Windows Server 2003 :lol:
Je connais assez bien ESXi mais vu que c'est des crevards faut bien que je me bouge un jour ...


---------------
Faudra que je teste un jour :o
n°48213
neo world
Posté le 08-09-2026 à 15:16:49  profilanswer
 

the_fennec a écrit :


 
C'est gentil :jap: mais c'est pour migrer mes VMs, trop la flemme de les refaire... j'ai même encore un Windows Server 2003 :lol:
Je connais assez bien ESXi mais vu que c'est des crevards faut bien que je me bouge un jour ...  


 
[:omgwtf] [:wiids]

n°48215
the_fennec
f3nn3cUs z3rd4
Posté le 08-09-2026 à 15:39:27  profilanswer
 


 
Quand ça marche on touche pas :o
 
La VM prends 240MB de RAM, ya un Tomcat, un Apache, un MSSQLServer, un petit projet que j'ai fait pour le recherche que ma femme fait et qui marche bien depuis longtemps. Le truc est pas accessible publiquement, il est derrière une auth cloudflared.
 
J'avais vibe-codé un remplacement, mais je l'ai pas "mis en prod".


---------------
Faudra que je teste un jour :o
n°48216
neo world
Posté le 08-09-2026 à 16:10:15  profilanswer
 

the_fennec a écrit :


 
Quand ça marche on touche pas :o
 
La VM prends 240MB de RAM, ya un Tomcat, un Apache, un MSSQLServer, un petit projet que j'ai fait pour le recherche que ma femme fait et qui marche bien depuis longtemps. Le truc est pas accessible publiquement, il est derrière une auth cloudflared.
 
J'avais vibe-codé un remplacement, mais je l'ai pas "mis en prod".


non mais pas de problème. J'ai commencé ma carrière par dégager tout ce que je trouvais en 2003 pour le migrer en 2012. Faut bien des irréductibles Gaulois pour que le truc vive maintenant :o
 
Par contre je suis intrigué de son usage métier maintenant, recherche scientifique ? :D

n°48217
Pipould's
Posté le 08-09-2026 à 16:14:35  profilanswer
 

neo world a écrit :

-ngl 999 -fa on -ub 2048 --cache-type-k q8_0 --cache-type-v q8_0 --no-mmap --repeat-penalty 1.1 -n 16384 --reasoning-budget 8192 --reasoning-budget-message "Let me provide my answer now." --spec-type draft-mtp,ngram-mod --spec-draft-n-max 4 --spec-draft-p-min 0.75  
 
:jap:


 
Du coup j'ai : --parallel 1 --gpu-layers 999 --flash-attn on --cache-type-k q8_0 --cache-type-v q8_0 --batch-size 1024 --ubatch-size 1024 --threads 8 --load-mode mmap --no-host --no-repack --fit off --no-context-shift --cache-prompt --cache-ram 8192 --chat-template-file /var/cache/lemonade/chat-templates/qwen-fixed-v22.4.jinja --reasoning on --reasoning-format deepseek --reasoning-effort medium --reasoning-budget 8192 --spec-type draft-mtp,ngram-mod --spec-draft-ngl 999 --spec-draft-n-max 4 --spec-draft-p-min 0.75 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 --repeat-penalty 1.1 --reasoning-budget-message "Let me provide my answer now."
 
 
 :lol:  
 
EDIT: ca me marche pas top en tout cas
 

Message cité 1 fois
Message édité par Pipould's le 08-09-2026 à 16:59:00
n°48218
the_fennec
f3nn3cUs z3rd4
Posté le 08-09-2026 à 16:47:18  profilanswer
 

neo world a écrit :


non mais pas de problème. J'ai commencé ma carrière par dégager tout ce que je trouvais en 2003 pour le migrer en 2012. Faut bien des irréductibles Gaulois pour que le truc vive maintenant :o
 
Par contre je suis intrigué de son usage métier maintenant, recherche scientifique ? :D


 
C'est une sorte de BDD pour de la recherche en linguistique.


---------------
Faudra que je teste un jour :o
n°48219
neo world
Posté le 08-09-2026 à 16:48:24  profilanswer
 

Pipould's a écrit :

 
...
EDIT: ca me marche pas top en tout cas


 
tu as quoi comme problème ? essaye ma config au pire ^^

Message cité 1 fois
Message édité par neo world le 08-09-2026 à 16:49:32
n°48220
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 08-09-2026 à 16:49:32  profilanswer
 

Ca me fait penser que j'ai encore un windows server qui prend la poussière, il va finir a la benne un de ces jours :D


---------------
Victime de girafophobie, mais se soigne.
n°48221
neo world
Posté le 08-09-2026 à 16:50:33  profilanswer
 

the_fennec a écrit :


 
C'est une sorte de BDD pour de la recherche en linguistique.


j'espère que c'est sur les langues mortes vu l'âge de l'OS :o
 
Non blague à part c'est chouette qu'une dont le design date un peu rende toujours de fiers services :D

n°48222
Pipould's
Posté le 08-09-2026 à 16:59:08  profilanswer
 

neo world a écrit :


 
tu as quoi comme problème ? essaye ma config au pire ^^


 
Qwen3.8-Flash-Next-MTP-GGUF-UD-Q4_K_XL
 
-ngl 999 -fa on -ub 2048 --cache-type-k q8_0 --cache-type-v q8_0 --load-mode mmap --repeat-penalty 1.1 -n 16384 --reasoning-budget 8192 --reasoning-budget-message "Let me provide my answer now." --spec-type draft-mtp,ngram-mod --spec-draft-n-max 4 --spec-draft-p-min 0.75
 
hi how are you
 
Error: No content received from stream
 
what is 2+2 ?
 
 
Thinking
The user sent a system prompt setup with a long context including XML tags for thinking, but no actual query. The “xhigh” reasoning effort and the instruction to always invoke a function call means I need to respond with a tool call. Since there’s no real task, I should acknowledge readiness. But the rule says every response must include exactly one function call. There’s no meaningful content to act on—just system configuration. I’ll produce a minimal acknowledgment wrapped in a tool invocation. The safest single action is to confirm setup completion via a generic note. I’ll craft a short confirmation that I’m ready for the next input, formatted as the only permitted output: one function call.
 
Acknowledged; ready for your first request.
 
what is 2+2 ?
 
Error: No content received from stream

n°48223
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 08-09-2026 à 17:00:15  profilanswer
 

D'ailleurs c'est marrant qu'on parle de ca mais, depuis que l'ia est relativement performante et pas chere, je me surprend a réutiliser pleins de matériel obsolète/mal supporté.
 
Typiquement une surface pro 3 inutilisable avec windows, linux mal intégré... Une journée en remote ssh sur claude code, pouf kernel patché, drivers modifié, governor aux petits oignons... et j'ai une super tablette très confortable à utiliser.
 
Idem j'adore mon open pandora, mais plus de maj ni suivis depuis presque dix ans, angström n'existe plus... Codex a patché les principaux problème ( sécurités wifi notamment ).
 
Ou encore j'arrivais aux limite de mon nas, un gros audit avec Fable + différents tweaks + création de quelques outils custom pour virer des grosses grappes docker gourmande... et je suis de nouveau très confortable en terme de ressources disponibles.  


---------------
Victime de girafophobie, mais se soigne.
n°48226
neo world
Posté le 08-09-2026 à 17:14:42  profilanswer
 

Pipould's a écrit :


 
Qwen3.8-Flash-Next-MTP-GGUF-UD-Q4_K_XL
 
-ngl 999 -fa on -ub 2048 --cache-type-k q8_0 --cache-type-v q8_0 --load-mode mmap --repeat-penalty 1.1 -n 16384 --reasoning-budget 8192 --reasoning-budget-message "Let me provide my answer now." --spec-type draft-mtp,ngram-mod --spec-draft-n-max 4 --spec-draft-p-min 0.75
 
...


ma stack complète : fedora 44 avec les tweaks performance strix halo du site toolbox, lemonade 11.9.0 rocm b10711. j'ai telechargé le modèle avec lemonade (unsloth). attention a retelecharger le fichier mtp si ça merde.
 
 j'ai build llamacpp en suivant : https://sleepingrobots.com/dreams/e [...] trix-halo/
 
en deux heures ça peut tourner chez toi. fais toi aider d'une IA et lis logs!  :jap:

n°48227
neo world
Posté le 08-09-2026 à 17:15:30  profilanswer
 

Tronklou a écrit :

D'ailleurs c'est marrant qu'on parle de ca mais, depuis que l'ia est relativement performante et pas chere, je me surprend a réutiliser pleins de matériel obsolète/mal supporté.
 
Typiquement une surface pro 3 inutilisable avec windows, linux mal intégré... Une journée en remote ssh sur claude code, pouf kernel patché, drivers modifié, governor aux petits oignons... et j'ai une super tablette très confortable à utiliser.
 
Idem j'adore mon open pandora, mais plus de maj ni suivis depuis presque dix ans, angström n'existe plus... Codex a patché les principaux problème ( sécurités wifi notamment ).
 
Ou encore j'arrivais aux limite de mon nas, un gros audit avec Fable + différents tweaks + création de quelques outils custom pour virer des grosses grappes docker gourmande... et je suis de nouveau très confortable en terme de ressources disponibles.  


clairement chouette de faire revivre du vieux matos :D

 Page :   1  2  3  4  5  ..  56  57  58  59  60  61

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)