Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
1900 connectés 

 


Je génère ...
Sondage à 3 choix possibles.
Ce sondage expirera le 20-09-2026 à 10:00




Attention si vous cliquez sur "voir les résultats" vous ne pourrez plus voter

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  56  57  58  59  60  61
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°47946
moyen_moin​s
chat réincarné
Posté le 06-09-2026 à 15:29:02  profilanswer
 

Reprise du message précédent :
Je suis en train de tester un truc depuis quelques jours mais pour des raisons de "confidentialité", je m'oblige à faire ça en local.
J'utilise donc un Qwen 3.8 en Q4_K_M avec MTP sur mon combo 9070xt+9060xt. J'arrive à monter à 155k de contexte (il y a un réel besoin) avec kv cache en q8 (29GB de pris).
Bon outre les problèmes de drivers et de fuite mémoire de firefox qui font planter le pc de temps en temps (faudrait pas dépasser 27.5-28GB apparemment), je me retrouve à générer quand même pas mal de tokens.

 

Bref, hier soir j'ai essayé de lancer une "analyse" : 4-5 étapes avec revue, en moyenne par étape, ça génère entre 30000 et quasi 60000 tokens (voire plus entre 15 à 20 t/s mais prefill entre 150 et 180t/s sur la longueur) en fonction de la taille du contexte.
Bon, on va pas se mentir, c'est long car il y a une validation humaine nécessaire de l'analyse à la fin de chaque étape.
D'ici quelques semaines/mois, je compte investir pour mon petit hobby (cramer de l'électricité donc) :o
Disons fin d'année, début d'année prochaine.

 

Quel est, selon vous, le meilleur investissement à faire dans un budget d'environ 4-5k ? Je suppose qu'avec ce genre de budget, on resterait dur des modèles denses de 27-30B ou des MoE de 120B mais ça devrait largement me suffire.  :jap:

Message cité 1 fois
Message édité par moyen_moins le 06-09-2026 à 16:08:14
n°47951
Pipould's
Posté le 06-09-2026 à 15:47:29  profilanswer
 

moyen_moins a écrit :

Je suis en train de tester un truc depuis quelques jours mais pour des raisons de "confidentialité", je m'oblige à faire ça en local.
J'utilise donc un Qwen 3.8 en Q4_K_M avec MTP sur mon combo 9070xt+9060xt. J'arrive à monter à 155k de contexte (il y a un réel besoin) avec kv cache en q8 (29GB de pris).
Bon outre les problèmes de drivers et de fuite mémoire de firefox qui font planter le pc de temps en temps (faudrait pas dépasser 27.5-28GB apparemment), je me retrouve à générer quand même pas mal de tokens.

 

Bref, hier soir j'ai essayé de lancer une "analyse" : 4-5 étapes avec revue, en moyenne par étape, ça génère entre 30000 et quasi 60000 tokens (voire plus entre 15 à 20 t/s) en fonction de la taille du contexte.
Bon, on va pas se mentir, c'est long car il y a une validation humaine nécessaire de l'analyse à la fin de chaque étape.
D'ici quelques semaines/mois, je compte investir pour mon petit hobby (cramer de l'électricité donc) :o
Disons fin d'année, début d'année prochaine.

 

Quel est, selon vous, le meilleur investissement à faire dans un budget d'environ 4-5k ? Je suppose qu'avec ce genre de budget, on resterait dur des modèles denses de 27-30B ou des MoE de 120B mais ça devrait largement me suffire.  :jap:


Attendre un an pour la prochaine gen de gpu dédiés. Soit les prendre, soit prendre des anciens d'occasion.

 

Sinon pour un playground, bosgame M5 et basta

n°47954
speedboyz3​0
Guide Michelin :o
Posté le 06-09-2026 à 16:30:30  profilanswer
 

Pas mal de nouveautés à venir d'ici 1 mois:  
 
Nvidia RTX Spark N1X
AMD Ryzen AI MAX+ 495
Mac Studio M5 Max et Ultra
 
De quoi faire avec 5k, je vais attendre un peu perso :jap:

n°47955
moyen_moin​s
chat réincarné
Posté le 06-09-2026 à 16:40:17  profilanswer
 

merci pour les conseils :jap:

n°47967
the_fennec
f3nn3cUs z3rd4
Posté le 06-09-2026 à 19:29:52  profilanswer
 

Comparaison des abliterations sur 27B:
https://www.reddit.com/r/LocalLLaMA [...] _base_167/
 
TL;DR:

Citation :

orcarouter 82.2%, the winner. Arditi-style single direction at layer 38, 131 matrices, and the only card where every claim checked out against the weights. Best copyright unlock in the set at 39%


https://huggingface.co/orcarouter/Q [...] Uncensored
https://huggingface.co/orcarouter/Q [...] sored-GGUF


Message édité par the_fennec le 06-09-2026 à 19:32:53

---------------
Faudra que je teste un jour :o
n°47968
the_fennec
f3nn3cUs z3rd4
Posté le 06-09-2026 à 19:44:35  profilanswer
 

Activité du WE, boîtier pour une BC250:
 
https://makerworld.com/en/models/27 [...] -case-v1-0
https://i.imgur.com/H24NyPc.png
 
https://i.imgur.com/RaOY2Bl.jpeg
 
Bon l'alim rentre pas, âmes sensible s'abstenir, attention HB:

Spoiler :


https://i.imgur.com/ptx42NX.jpeg


 
Bon je valide les températures et je vais peut être redesign un chouilla pour faire passer mon alim. Pour le moment c'est plustot pas mal, 4/5 degrés de gagnés, mais faudrait que je teste avec un modèle a 100% sur la carte. La je teste Qwen Next en UD_IQ1_S.
 
J'ai aussi reçu ma RAM, j'ai 64GB maintenant :love: reste plus que mon nouveau CPU.
 
Sinon mudler a sortis un modèle nano prévu pour passer dans 48GB de VRAM, DL en cours:
https://huggingface.co/mudler/Qwen3 [...] -APEX-GGUF

Message cité 1 fois
Message édité par the_fennec le 06-09-2026 à 20:26:40

---------------
Faudra que je teste un jour :o
n°47970
neo world
Posté le 06-09-2026 à 19:59:38  profilanswer
 

tu l'as imprimé toi même ? :love:
 
J'ai vu plein de boitiers imprimés sur ebay mais genre 50 balles hors frais de port et pas un gramme de tôle dedans  :lol:  
ah oui c'est agressif : For 4.5x compression against a 354 GB original, with 45% of the model at roughly 1.6 bits per weight in Nano, that is a good result  :pt1cable:

n°47973
the_fennec
f3nn3cUs z3rd4
Posté le 06-09-2026 à 20:33:21  profilanswer
 

Oui, avec une Bambulab c'est vraiment facile!
 
J'avais oublié le lien:  
https://makerworld.com/en/models/27 [...] -case-v1-0
 
Testé vite fait le modèle de Mudler, ça rentre pas... au poil de cul :/ il me manque 200MB de VRAM sur la RTX. J'aimerais vraiment un ngl all avec 110k de contexte!


---------------
Faudra que je teste un jour :o
n°47976
neo world
Posté le 06-09-2026 à 20:48:04  profilanswer
 

La finition est vraiment propre (non pas la découpe :o) tu as passé un coup de ponçage ou autre pour avoir la finition « plastique moulé » ?

Message cité 1 fois
Message édité par neo world le 06-09-2026 à 20:48:45
n°47977
neo world
Posté le 06-09-2026 à 20:49:49  profilanswer
 

the_fennec a écrit :

Oui, avec une Bambulab c'est vraiment facile!
 
Testé vite fait le modèle de Mudler, ça rentre pas... au poil de cul :/ il me manque 200MB de VRAM sur la RTX. J'aimerais vraiment un ngl all avec 110k de contexte!


Vu le la quantisation aggressive m’est avis que le résultat est meilleur avec un 27b …

Message cité 1 fois
Message édité par neo world le 06-09-2026 à 20:50:04
n°47978
XaTriX
Posté le 06-09-2026 à 20:53:39  profilanswer
 

bordel la découpe [:rofl]


---------------
[:dawa]
n°47982
the_fennec
f3nn3cUs z3rd4
Posté le 06-09-2026 à 21:15:02  profilanswer
 

neo world a écrit :

La finition est vraiment propre (non pas la découpe :o) tu as passé un coup de ponçage ou autre pour avoir la finition « plastique moulé » ?


Non, c'est juste du filament Bambulab Silk+, aucun traitement.
 

neo world a écrit :


Vu le la quantisation aggressive m’est avis que le résultat est meilleur avec un 27b …


Mon plus beau flappy vient de Qwen Next en UD_IQ1_S
 

XaTriX a écrit :

bordel la découpe [:rofl]


 
J'ai mis un spoiler, c'est pas pour rien :o


---------------
Faudra que je teste un jour :o
n°47988
Pipould's
Posté le 06-09-2026 à 21:33:06  profilanswer
 

the_fennec a écrit :

Activité du WE, boîtier pour une BC250:
 
https://makerworld.com/en/models/27 [...] -case-v1-0
https://i.imgur.com/H24NyPc.png
 
https://i.imgur.com/RaOY2Bl.jpeg
 
Bon l'alim rentre pas, âmes sensible s'abstenir, attention HB:


 
Bon je valide les températures et je vais peut être redesign un chouilla pour faire passer mon alim. Pour le moment c'est plustot pas mal, 4/5 degrés de gagnés, mais faudrait que je teste avec un modèle a 100% sur la carte. La je teste Qwen Next en UD_IQ1_S.
 
J'ai aussi reçu ma RAM, j'ai 64GB maintenant :love: reste plus que mon nouveau CPU.
 
Sinon mudler a sortis un modèle nano prévu pour passer dans 48GB de VRAM, DL en cours:
https://huggingface.co/mudler/Qwen3 [...] -APEX-GGUF


 
Magnifique.  
 
ABS , PETG ou PLA ? :o  

n°48004
moyen_moin​s
chat réincarné
Posté le 07-09-2026 à 01:44:33  profilanswer
 

J'ai testé rapido un ornith 1.5 35B (Ornith-1.5-35B-A3B-Abliterated-MTP-UD-APEX-GGUF ~25GB), je trouve le résultat assez moyen (mais 40t/s) sur de la génération de js/html.
 
mon adaptateur nvme=> pcie arrive bientôt, je sens que je vais galérer mais le bc-250 va bientôt rentrer en service. :o

n°48005
neo world
Posté le 07-09-2026 à 01:51:02  profilanswer
 

ah ! je me souviens plus, tu voulais lui coller une carte réseau ou un GPU ?  
 
En tous cas enjoy :D

n°48006
moyen_moin​s
chat réincarné
Posté le 07-09-2026 à 02:00:19  profilanswer
 

J'ai une RX6700 qui traine, ça devrait faire 26GB de VRAM et en fonction de ce que je fais plus tard... on verra :o

n°48007
neo world
Posté le 07-09-2026 à 02:02:18  profilanswer
 

moyen_moins a écrit :

J'ai une RX6700 qui traine, ça devrait faire 26GB de VRAM et en fonction de ce que je fais plus tard... on verra :o


avec tout ce scraping ça va finir qu'on va construire une grille de calcul avec des bouts de matos qui traine chez tout le monde pour faire tourner le K3 du topic @ moult tokens par seconde :o

n°48008
moyen_moin​s
chat réincarné
Posté le 07-09-2026 à 02:19:01  profilanswer
 

on pourrait surtout monter un pool d'users qui auraient accès à un serveur relativement costaud configuré par M300A :o
les bricoles en local, le heavy lifting sur le serveur privé :o

n°48009
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 07-09-2026 à 04:45:31  profilanswer
 

Team bc250 ghetto  
https://rehost.diberie.com/Picture/Get/r/541960
https://rehost.diberie.com/Picture/Get/r/541961

Message cité 2 fois
Message édité par Tronklou le 07-09-2026 à 04:47:04

---------------
Victime de girafophobie, mais se soigne.
n°48015
the_fennec
f3nn3cUs z3rd4
Posté le 07-09-2026 à 08:05:24  profilanswer
 

Pipould's a écrit :


 
Magnifique.  
 
ABS , PETG ou PLA ? :o  


:jap: PLA
 


 
Mais way, la ya du niveau :love:
T'as ouverts les rads quand même? :o

Message cité 1 fois
Message édité par the_fennec le 07-09-2026 à 08:05:43

---------------
Faudra que je teste un jour :o
n°48016
neo world
Posté le 07-09-2026 à 08:10:53  profilanswer
 

y'a un côté post apo très assumé :love:

n°48037
the_fennec
f3nn3cUs z3rd4
Posté le 07-09-2026 à 10:22:34  profilanswer
 

Codacus teste Qwen Next Flash:
https://www.youtube.com/watch?v=IH8XmxiwliQ
https://github.com/thecodacus/spec-wins
 
Un peu déçu on a apprend pas grand-chose au final, si ce n'est qu'il tient tête a Opus 5!


---------------
Faudra que je teste un jour :o
n°48039
SynE
Agri du dessert
Posté le 07-09-2026 à 10:26:33  profilanswer
 


 
Au final mon installation est presque propre :o
 
Il manquait du pla pour finir le carter, j'ai du changer de couleur  [:petrus75]  
 
https://rehost.diberie.com/Picture/Get/f/541992

Message cité 1 fois
Message édité par SynE le 07-09-2026 à 10:28:18
n°48040
moyen_moin​s
chat réincarné
Posté le 07-09-2026 à 10:34:29  profilanswer
 

Vous avez tous "ouvert" le radiateur ?
J'ai imprimé un truc moche mais qui permet d'installer un 120mm pour souffler à travers mais j'ai bien peur qu'il soit pas assez péchu :/

n°48041
the_fennec
f3nn3cUs z3rd4
Posté le 07-09-2026 à 10:36:47  profilanswer
 

Non, j'ai rien fait d'irréversible. J'ai même pas repaste encore.


---------------
Faudra que je teste un jour :o
n°48042
SynE
Agri du dessert
Posté le 07-09-2026 à 10:37:50  profilanswer
 

J'ai ouvert la totalité et dessiné un carter en push pull, plus haut que le rad, avec une cloison pour forcer l'air dans le rad, et avec le pull au dessus du ssd pour qu'il soit pas a 60°.
 
Mais avant de faire tourner ollama, c'est mon pc, d'ou la recherche pour avoir un cooling potable.

n°48050
the_fennec
f3nn3cUs z3rd4
Posté le 07-09-2026 à 11:30:27  profilanswer
 

Tu utilises tes BC250 comme PC?
Pas trop chiant de pas avoir l'accélération vidéo?


---------------
Faudra que je teste un jour :o
n°48054
SynE
Agri du dessert
Posté le 07-09-2026 à 11:39:38  profilanswer
 

J'utilisais, sous fedora.
 
Ca ne m'a pas manqué, le cpu fait le taf au final même pour décoder.  
 
Il y a des contournements pour lire les vidéos dans les softs sans le décodage materiel.
 
C'est surtout le manque de connectiques pour le stockage et le manque de ram qui m'ont fait remettre un "vrai" pc.

n°48059
the_fennec
f3nn3cUs z3rd4
Posté le 07-09-2026 à 12:32:49  profilanswer
 

Oui j'ai vu une impl de decode HW en shaders Vulkan mais ça serait mieux de débloquer VCN, vilain Sony :o
 
https://github.com/simpmix/bc250-encoding-decoding-fix


---------------
Faudra que je teste un jour :o
n°48061
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 07-09-2026 à 12:52:29  profilanswer
 

 
the_fennec a écrit :

 

Mais way, la ya du niveau :love:
T'as ouverts les rads quand même? :o

 

Of course, sinon c'était une fournaises  :D

 
neo world a écrit :

y'a un côté post apo très assumé :love:

 

J'ai failli marquer T-51 sur le côté mais je me suis retenu  :sol:

 
moyen_moins a écrit :

Vous avez tous "ouvert" le radiateur ?
J'ai imprimé un truc moche mais qui permet d'installer un 120mm pour souffler à travers mais j'ai bien peur qu'il soit pas assez péchu :/

 

Oui, même avec du ventilo de bourrin ça surchauffais en inférence longue


---------------
Victime de girafophobie, mais se soigne.
n°48063
moyen_moin​s
chat réincarné
Posté le 07-09-2026 à 12:59:21  profilanswer
 

Tronklou a écrit :


 
Oui, même avec du ventilo de bourrin ça surchauffais en inférence longue


:jap:
je verrai mais bon, je pense que je vais pas y couper :/

n°48068
SynE
Agri du dessert
Posté le 07-09-2026 à 14:21:10  profilanswer
 

Clairement sans ouvrir, il faut un montage qui souffle a mort dedans (pas un peu).
 
Sinon pour ouvrir les ailettes j'ai fait ça avec une paire de ciseaux et un bic pour poser les ciseaux dessus (pour ne pas abimer en avançant), découpe super propre mais ça prend du temps.
 
Et pour le montage soit tu n'ouvre que le centre et tu mets un 120 puissant genre P12 pro, mais ça fait du bruit et le ssd prend l'air chaud en pleine gueule.  
Soit tu ouvres tout et tu fait un montage push pull pour que l'air cycle partout dans le radiateur.
 
Pour le repaste, c'est vraiment si ça chauffe trop, certaines cartes sont ok parce que neuve ou très récente, le mieux étant un pad thermique haute conductivité pour le soc.

n°48069
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 07-09-2026 à 14:22:59  profilanswer
 

J'ai pris le tool a imprimer + marteau , en 10 minutes montre en main c'est fait.
Par contre mettre des gants épais : ça coupe fort si on se rate  :cry:


---------------
Victime de girafophobie, mais se soigne.
n°48070
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 07-09-2026 à 14:24:01  profilanswer
 

SynE a écrit :

 

Au final mon installation est presque propre :o

 

Il manquait du pla pour finir le carter, j'ai du changer de couleur  [:petrus75]

 

https://rehost.diberie.com/Picture/Get/f/541992


Je confirme que c'est bien plus propre que moi  :D


---------------
Victime de girafophobie, mais se soigne.
n°48076
moyen_moin​s
chat réincarné
Posté le 07-09-2026 à 16:20:14  profilanswer
 

Tronklou a écrit :

J'ai pris le tool a imprimer + marteau , en 10 minutes montre en main c'est fait.
Par contre mettre des gants épais : ça coupe fort si on se rate  :cry:


 [:lectrodz]

n°48077
SynE
Agri du dessert
Posté le 07-09-2026 à 16:25:44  profilanswer
 


 
Un truc comme ça https://www.printables.com/model/12 [...] er?lang=fr
 
Mais j'ai pas voulu, je préfère couper proprement. :D  

n°48083
anyb0dy
Posté le 07-09-2026 à 18:08:30  profilanswer
 

Gourage de topic, c’est à côté l’Ukraine  :D

n°48115
neo world
Posté le 07-09-2026 à 23:08:00  profilanswer
 

trois jours que Qwen 3.8 flash next Q4K XL tourne : rock stable :love:
 
Je suis toujours sur un premier developpement de connecteur (normalement assez simple mais je suis pas expert) mais les allers/retours avec OCR fonctionnent parfaitement, les appels outils aussi et il développe comme les meilleurs dev seniors : il se goure, s'en aperçoit seul et fini par corriger  :whistle:  
 
Je continue de blinder autour de pi.dev :
=> Scan toutes les 5 minutes via clamAV pour chercher des potentielles merdes téléchargées
=> Remonter dans wazuh tous les appels outils suspects (curl, wget, npm, apt, nc ...) faudra que je regarde comment exploiter la masse d’événements qui en ressortira mais ça donnera une base de test et d'audit
 
Je vais probablement l'enfermer derrière un reverse proxy à terme avec des dictionnaires de mots clés (format clés API notammenrt) et de menaces connues (skills pourris, des git push là où ça ne devrait pas arriver, commande de suppression de données) pour l'empêcher de dévoiler des trucs importants.
 
C'est quand même un peu bordelique de le suivre comme il bosse de longues heures seul mais j'aime bien ses rapports (par contre faut que je lui rappel de l'ecrire en anglais. C'est toujours un peu la merde de remettre en context à partir du français) :
https://rehost.diberie.com/Picture/Get/f/542142
 
Côté Strix halo bosgame pc : j'ai rajouté deux 120mm aux ouvertures de mon rack (IP65 avec filtres à poussières) histoire que l'air frais aille vers lui au lieu de juste compter sur le ventilateur d'extraction : il tourne à 80° avec des pointes de 90w sur la puce (le CPU est stable à 5% donc je pense que c'est pour ça que je n’atteint pas le max théorique du package). Je vais finir par tenter l'overclock ...  :whistle:

Message cité 2 fois
Message édité par neo world le 07-09-2026 à 23:20:42
n°48117
Pipould's
Posté le 07-09-2026 à 23:30:52  profilanswer
 

neo world a écrit :

trois jours que Qwen 3.8 flash next Q4K XL tourne : rock stable :love:
 
Je suis toujours sur un premier developpement de connecteur (normalement assez simple mais je suis pas expert) mais les allers/retours avec OCR fonctionnent parfaitement, les appels outils aussi et il développe comme les meilleurs dev seniors : il se goure, s'en aperçoit seul et fini par corriger  :whistle:  
 
Je continue de blinder autour de pi.dev :
=> Scan toutes les 5 minutes via clamAV pour chercher des potentielles merdes téléchargées
=> Remonter dans wazuh tous les appels outils suspects (curl, wget, npm, apt, nc ...) faudra que je regarde comment exploiter la masse d’événements qui en ressortira mais ça donnera une base de test et d'audit
 
Je vais probablement l'enfermer derrière un reverse proxy à terme avec des dictionnaires de mots clés (format clés API notammenrt) et de menaces connues (skills pourris, des git push là où ça ne devrait pas arriver, commande de suppression de données) pour l'empêcher de dévoiler des trucs importants.
 
C'est quand même un peu bordelique de le suivre comme il bosse de longues heures seul mais j'aime bien ses rapports (par contre faut que je lui rappel de l'ecrire en anglais. C'est toujours un peu la merde de remettre en context à partir du français) :
https://rehost.diberie.com/Picture/Get/f/542142
 
Côté Strix halo bosgame pc : j'ai rajouté deux 120mm aux ouvertures de mon rack (IP65 avec filtres à poussières) histoire que l'air frais aille vers lui au lieu de juste compter sur le ventilateur d'extraction : il tourne à 80° avec des pointes de 90w sur la puce (le CPU est stable à 5% donc je pense que c'est pour ça que je n’atteint pas le max théorique du package). Je vais finir par tenter l'overclock ...  :whistle:


 
C'est quoi ta config exacte pour le modele ?  

n°48118
neo world
Posté le 07-09-2026 à 23:33:30  profilanswer
 

-ngl 999 -fa on -ub 2048 --cache-type-k q8_0 --cache-type-v q8_0 --no-mmap --repeat-penalty 1.1 -n 16384 --reasoning-budget 8192 --reasoning-budget-message "Let me provide my answer now." --spec-type draft-mtp,ngram-mod --spec-draft-n-max 4 --spec-draft-p-min 0.75  
 
:jap:

n°48120
neo world
Posté le 07-09-2026 à 23:49:08  profilanswer
 

Subtilité que j'ai oublié de préciser : j'ai mis le contexte natif max de 262k avec compactage à 93% de cette valeur et surtout je n'utilise pas le llama.cpp natif mais une version compilée en suivant les recommandations d'atomic chat pour le strix halo.
 
Aucune idée si ça aide ou si ça empire les perfs donc attention avant de suivre mon exemple :D

 Page :   1  2  3  4  5  ..  56  57  58  59  60  61

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)