Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
4036 connectés 

 


Quel titre pour notre topic ?
Sondage à 8 choix possibles.
Ce sondage expirera le 15-08-2026 à 10:00




Attention si vous cliquez sur "voir les résultats" vous ne pourrez plus voter

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  28  29  30  31  32  33
Page Suivante
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°44509
the_fennec
f3nn3cUs z3rd4
Posté le 09-08-2026 à 12:37:21  profilanswer
 

Reprise du message précédent :
Merci, mais c'est bon, j'en ai deux en 2.5g :jap:
 
J'ai pris une autre carte pcie usb en chipset Fresco Logic FL1100 pour voir si ça me permet de remettre le deuxième GPU. Je verrais plus tard pour le réseau.


---------------
Faudra que je teste un jour :o
n°44510
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 09-08-2026 à 13:26:09  profilanswer
 

Force avec tes galères, perso les bc250 sont rockstables, je n'y touche plus :O
 
J'ai chopé 128gb de lrdimm en ddr3, reste a chiner une cm de workstation apachere :D


---------------
Victime de girafophobie, mais se soigne.
n°44511
neo world
Posté le 09-08-2026 à 13:33:20  profilanswer
 

Tronklou a écrit :

Force avec tes galères, perso les bc250 sont rockstables, je n'y touche plus :O
 
J'ai chopé 128gb de lrdimm en ddr3, reste a chiner une cm de workstation apachere :D


 :love: Bon je sais pas quelles performances tu en attends vs tes BC250 :o

n°44512
moyen_moin​s
chat réincarné
Posté le 09-08-2026 à 14:40:47  profilanswer
 

Tronklou a écrit :

Force avec tes galères, perso les bc250 sont rockstables, je n'y touche plus :O
 
J'ai chopé 128gb de lrdimm en ddr3, reste a chiner une cm de workstation apachere :D

 
je débarque surement (en plus d'être un noob) mais tes bc250 avec 16GB, t'arrives à les connecter de manière efficace pour faire de l'inférence ?
j'ai 2 cg 16GB dans ma relativement vieille config mais j'arrive rarement à dépasser du Q6 sur du 27B avec un contexte intéressant, y'a toujours une partie de la RAM de la CG principale qu'on peut pas toucher (sous windows) j'ai l'impression.;
j'ai toujours des doutes sur les version Q4 sur des "petits" modèles, j'ai été déçu quelques fois (après, je fais ça plus par geekerie qu'autre chose mais j'aime l'idée de tout pouvoir faire en local) :o

n°44513
the_fennec
f3nn3cUs z3rd4
Posté le 09-08-2026 à 15:49:01  profilanswer
 

Tronklou a écrit :

Force avec tes galères, perso les bc250 sont rockstables, je n'y touche plus :O
 
J'ai chopé 128gb de lrdimm en ddr3, reste a chiner une cm de workstation apachere :D


 
Merci! De mon coté je chercher 2x16gb de DDR4 en 3200, mais c'est juste abusé les tarifs :( J'attends la fin du rampocalypse comme tout le monde ...
 

moyen_moins a écrit :

 
je débarque surement (en plus d'être un noob) mais tes bc250 avec 16GB, t'arrives à les connecter de manière efficace pour faire de l'inférence ?
j'ai 2 cg 16GB dans ma relativement vieille config mais j'arrive rarement à dépasser du Q6 sur du 27B avec un contexte intéressant, y'a toujours une partie de la RAM de la CG principale qu'on peut pas toucher (sous windows) j'ai l'impression.;
j'ai toujours des doutes sur les version Q4 sur des "petits" modèles, j'ai été déçu quelques fois (après, je fais ça plus par geekerie qu'autre chose mais j'aime l'idée de tout pouvoir faire en local) :o


 
J'ai deux BC250 et une RTX 4060Ti 16GB et je peux (pouvais) utiliser Qwen 27B Q8 MTP avec 256K de contexte. Après j'ai dans les 100/s en prefil et 8/10/s en tg avec llama.cpp en RPC.
Si tu as déjà une BC250 tu peux l'ajouter, sinon elle sont chères maintenant :(
 
Pour ta RAM t'as essayé en désactivant mmap?


---------------
Faudra que je teste un jour :o
n°44515
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 09-08-2026 à 16:31:56  profilanswer
 

moyen_moins a écrit :


je débarque surement (en plus d'être un noob) mais tes bc250 avec 16GB, t'arrives à les connecter de manière efficace pour faire de l'inférence ?
j'ai 2 cg 16GB dans ma relativement vieille config mais j'arrive rarement à dépasser du Q6 sur du 27B avec un contexte intéressant, y'a toujours une partie de la RAM de la CG principale qu'on peut pas toucher (sous windows) j'ai l'impression.;
j'ai toujours des doutes sur les version Q4 sur des "petits" modèles, j'ai été déçu quelques fois (après, je fais ça plus par geekerie qu'autre chose mais j'aime l'idée de tout pouvoir faire en local) :o

 

Je ne vise pas des modèles aussi gros.
Enfaite moi j'ai besoins de faire de la parallélisation dans mon usage, traitement ocr sur d'énormes batch, traduction, synthèse...

 

Que des choses légères mais chronophage.
Donc avoir plusieurs server llm indépendants c'est super pratique car ça me permet soit d'aller vite sur un dossier ciblé en mettant toutes les ressources dessus, ou au contraire de laisser tourner en fond sur une tâche longue durée pendant que les autres sont libres.

 

Avant de vouloir investir il faut faut absolument déterminer ton usage.
Mon angle d'utilisation est vraiment extrêmement niche, par chance ça colle parfaitement avec du local avec peu de vram, mais sinon je n'aurais même pas acheté de bc250

 


---------------
Victime de girafophobie, mais se soigne.
n°44517
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 09-08-2026 à 16:34:16  profilanswer
 

neo world a écrit :


 :love: Bon je sais pas quelles performances tu en attends vs tes BC250 :o

 

Pour du gros model en déchargement ram + un gpu 12/16gb.
L'idée c'est d'avoir un agent performant qui fait du contrôle la nuit de ce qui a été fait le jour par le reste de mon workflow.
Du coup même si c'est lent c'est pas grave vu qu'il a environ 8h devant lui pour faire le boulot.


---------------
Victime de girafophobie, mais se soigne.
n°44519
moyen_moin​s
chat réincarné
Posté le 09-08-2026 à 16:46:21  profilanswer
 

J'ai l'impression que c'est plus pour gérer les écrans que ça prend 1-2Go de VRAM.
Mais c'est vrai que par défaut, mmap reste actif dans lmstudio il me semble mais je pensais que c'était surtout utile pour le démarrage/chargement du modèle [:paysan]
Sinon j'ai testé en rajoutant une 3eme carte (10GB de VRAM) mais j'ai pas l'impression que ça a amélioré les perfs globalement. De toute façon, je suis limité par la plateforme AM4 au niveau pcie.
 
J'utilise beaucoup le qwen 3.6 27B Q6 pour tester des idées pour avoir de bons 1er jets (gros rat inside, quand je peux je claque pas opencode go pour des petits trucs à tester) mais je passe pas les 64k de contexte avec le kv cache en q8 :/
 
J'ai le 3.6 35B qui reste pas mal (par exemple avec le mcp home assistant) et où je peux coller 128k de contexte et des perfs correctes mais moins bon pour certains trucs (et il boucle vite je trouve par exemple avec opencode).

n°44524
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 09-08-2026 à 17:18:08  profilanswer
 

Le mieux si tu peux c'est d'avoir une machine dédiée sous linux, avec llama.cpp

 

Pour le côté rat : DeepSeek v4 flash coûte presque rien, toujours moins que de racheter du matos.
Et au pire les quotas gratuits de GPT sont gargantuesque


---------------
Victime de girafophobie, mais se soigne.
n°44527
moyen_moin​s
chat réincarné
Posté le 09-08-2026 à 17:59:58  profilanswer
 

J'ai fini par prendre 10 balles chez deepseek et en V4 flash, ça part pas bien vite en effet :)
Mais bon, mon côté geek et me dire que "tout ça", ça vient de mon matos :D

 

edit: aux possesseurs de strix halo, vous avez testé les modèles quantized rocmfpx , y'a un gain réel et pas simplement bench ?


Message édité par moyen_moins le 09-08-2026 à 18:00:44
n°44528
the_fennec
f3nn3cUs z3rd4
Posté le 09-08-2026 à 18:05:47  profilanswer
 

\o/
 
C'est un bug dans Mesa! J'étais en 26.2.0~rc3 je suis repassé en 26.1.5-1 et tout remarche [:le_max].
J'irais ouvrir un bug/voter plus tard...
 
J'ai upgrade sans faire gaffe pour changer les IP des cartes USBs en installant network-manager (la flemme :D)
 
Au passage je vois que bc250-cu-live-manager gère l'unlock CPU aussi. J'ai remis 40cu, j'avais testé avec 24 au kazou :o
https://github.com/WinnieLV/bc250-cu-live-manager


---------------
Faudra que je teste un jour :o
n°44529
the_fennec
f3nn3cUs z3rd4
Posté le 09-08-2026 à 18:08:10  profilanswer
 

moyen_moins a écrit :


J'ai le 3.6 35B qui reste pas mal (par exemple avec le mcp home assistant) et où je peux coller 128k de contexte et des perfs correctes mais moins bon pour certains trucs (et il boucle vite je trouve par exemple avec opencode).


 
Je trouve que opencode est vraiment mauvais de ce coté maintenant en local, au point que je suis passé sur claude-code, puis finalement sur little-coder.


---------------
Faudra que je teste un jour :o
n°44533
moyen_moin​s
chat réincarné
Posté le 09-08-2026 à 18:45:52  profilanswer
 

faudra que j'essaie quand je rentrerai :jap:

n°44539
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 09-08-2026 à 19:28:31  profilanswer
 

J'ai pensé a toi the_fennec en voyant cet agent spécialement concus pour les longs travaux en local : https://github.com/PrimeIntellect-ai/prime-agent
 
Les premiers retour ont l'air très bon :D


---------------
Victime de girafophobie, mais se soigne.
n°44560
neo world
Posté le 09-08-2026 à 21:46:04  profilanswer
 

Pour ceux qui on du PCI express gen 5 et veulent donner toutes ses chances à K3 en mode colibri :
www.dealabs.com/bons-plans/ssd-gen [...] os-3388645
 
Bordel ils supportent le streaming sur deux SSD en simultané :
https://github.com/JustVugg/colibri [...] -bandwidth
 
J'ai un 2To à aller chercher sur mon routeur (me demandez pas ce qui m'a pris. on peut tous faire des mauvais choix :o) à remplacer par le NVME qui venait avec mon ancien laptop (un vénérable 1to qui valait pas grand chose à l'époque mais qui me paiera peut être des vacances si je le garde assez longtemps :o) pour jouer :love:


Message édité par neo world le 09-08-2026 à 22:12:07
n°44570
the_fennec
f3nn3cUs z3rd4
Posté le 09-08-2026 à 23:31:38  profilanswer
 

Tronklou a écrit :

J'ai pensé a toi the_fennec en voyant cet agent spécialement concus pour les longs travaux en local : https://github.com/PrimeIntellect-ai/prime-agent
 
Les premiers retour ont l'air très bon :D


 
:jap: je l'ai vu passé sur Reddit, mais ça parle pas de modèle local donc ça doit être un gouffre a contexte :o
Je testerais a l'occasion.
 
Pour l'instant j'ai rien a reprocher a little-coder, si ce n'est d'être basé sur pi et d'avoir une doc "LLM" aka de merde :o
Dans le README ils expliquent comment faire la config, mais en réalité ça marche pas, pi trouve sa propre config dans ~/.pi/agent/ ...
 
Et aussi il se foire sur la compaction des fois, mais je comprends pas trop ce qui ne va pas.


Message édité par the_fennec le 09-08-2026 à 23:32:15

---------------
Faudra que je teste un jour :o
n°44572
Pipould's
Posté le 09-08-2026 à 23:59:43  profilanswer
 

D'ailleurs, est-ce que vous avez un bon harness complet avec pi ? :-)  

n°44576
the_fennec
f3nn3cUs z3rd4
Posté le 10-08-2026 à 07:47:34  profilanswer
 

Je trouve pi seul trop limité, little-coder est bien.


Message édité par the_fennec le 10-08-2026 à 07:47:44

---------------
Faudra que je teste un jour :o
 Page :   1  2  3  4  5  ..  28  29  30  31  32  33
Page Suivante

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)