Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
4992 connectés 

 


Dernière réponse
Sujet : Infra IA : aide au choix et troubleshot de LLM Locaux
neo world tu as mis combien en context ? il a pas juste fait un oom (crash du modèle) ou simplement dépassé son context (j'imagine que ça interompt seulement ce qu'il y avait en cours)

Votre réponse
Nom d'utilisateur    Pour poster, vous devez être inscrit sur ce forum .... si ce n'est pas le cas, cliquez ici !
Le ton de votre message                        
                       
Votre réponse


[b][i][u][strike][spoiler][fixed][cpp][url][email][img][*]   
 
   [quote]
 

Options

 
Vous avez perdu votre mot de passe ?


Vue Rapide de la discussion
johto84

the_fennec a écrit :


 
C'est quoi ta CM? quelle gen le x4?
 
Teste tu verras bien. Si tu veux optimiser to mets un 35B avec les attentions layers sur la 70Ti.


 
 
Enfaite j'ai commander une 5060 ti 16go mais la j'ai une CM de merde avec un x1 en deuxieme slot LOOL, mais du coup je cherche une nouvelle CM par contre le problème c'est que en DDR4 sa n'existe pas du 8x 8x et j'ai 48go de ram atm sa me ferait mal au cul de devoir passer sur de la DDR5 juste pour avoir le 8x 8x sa fait un gros budget quand meme.  
 
Atm je cherche une Aorus elite en ddr4 z690 ou z790 pour avoir le x4 et précisément ce model pour faire rentré ma 70ti 3 slot sur le 5.0

johto84

Pipould's a écrit :


 
Pars du principe que t'auras 2 5060Ti alors...


 
Ouais c'est ce que je me disait, en 50/50 a 32go en tensor sa doit être strictement la meme que le double 60ti (qui est pas mauvais du tous xd y'a enormement de bench dessus c'est pas mal surtout avec le nvfp4)  
 
Tu est sur une asus créator sur ton double gpu c'est ça ? c'est du 8x 8x dessus ?  
 
Si le 4x me bride pas plus que sa et que sa fait genre 2 5060 ti a 32go sa me va

the_fennec

johto84 a écrit :

La 70ti a 2 fois plus de bande passante que la 60ti, c'est ce que je cherche a savoir sur le x4, apparemment sa serait 8go/s mais je sais pas trop si sa peut poser un real problème ou pas.  
 
car en gros dans un des cas je doit juste changer la CM et dans l'autre jdois prendre DDR5 + CM 8x 8x sa commence a piquer  
 
Et malheureusement j'ai pas la chance d'avoir une 5090 donc le double GPU est obligatoire pour avoir les 32go.  
 
Je veut pas utiliser le Pipeline mais plutôt en tensor, les gain c'est quasi du simple au double il me semble en terme de token/s


 
C'est quoi ta CM? quelle gen le x4?
 
Teste tu verras bien. Si tu veux optimiser to mets un 35B avec les attentions layers sur la 70Ti.

Pipould's

johto84 a écrit :


 
 
La 70ti a 2 fois plus de bande passante que la 60ti, c'est ce que je cherche a savoir sur le x4, apparemment sa serait 8go/s mais je sais pas trop si sa peut poser un real problème ou pas.  
 
car en gros dans un des cas je doit juste changer la CM et dans l'autre jdois prendre DDR5 + CM 8x 8x sa commence a piquer  
 
Et malheureusement j'ai pas la chance d'avoir une 5090 donc le double GPU est obligatoire pour avoir les 32go.  
 
Je veut pas utiliser le Pipeline mais plutôt en tensor, les gain c'est quasi du simple au double il me semble en terme de token/s


 
Pars du principe que t'auras 2 5060Ti alors...

the_fennec

Code :
  1. error loading model: unknown model architecture: 'muse-glimmer'


 
Plus qu'a attendre les builds ....

ibuprophet Ceci dit, avec la pénurie de composants qui s'annonce, tu ne risques pas trop de perte à tester
Pipould's

Code :
  1. +-----------------------------------------------------------------------------------------+
  2. | NVIDIA-SMI 595.84                 Driver Version: 595.84         CUDA Version: 13.2     |
  3. +-----------------------------------------+------------------------+----------------------+
  4. | GPU  Name                 Persistence-M | Bus-Id          Disp.A | Volatile Uncorr. ECC |
  5. | Fan  Temp   Perf          Pwr:Usage/Cap |           Memory-Usage | GPU-Util  Compute M. |
  6. |                                         |                        |               MIG M. |
  7. |=========================================+========================+======================|
  8. |   0  NVIDIA GeForce RTX 3090 Ti     On  |   00000000:01:00.0 Off |                  Off |
  9. | 80%   83C    P2            286W /  290W |   23630MiB /  24564MiB |    100%      Default |
  10. |                                         |                        |                  N/A |
  11. +-----------------------------------------+------------------------+----------------------+
  12. |   1  NVIDIA GeForce RTX 3090        On  |   00000000:03:00.0 Off |                  N/A |
  13. | 54%   71C    P2            255W /  260W |   23582MiB /  24576MiB |    100%      Default |
  14. |                                         |                        |                  N/A |
  15. +-----------------------------------------+------------------------+----------------------+
  16. +-----------------------------------------------------------------------------------------+
  17. | Processes:                                                                              |
  18. |  GPU   GI   CI              PID   Type   Process name                        GPU Memory |
  19. |        ID   ID                                                               Usage      |
  20. |=========================================================================================|
  21. |    0   N/A  N/A            3145      C   VLLM::Worker_TP0                      23620MiB |
  22. |    1   N/A  N/A            3191      C   VLLM::Worker_TP1                      23572MiB |
  23. +-----------------------------------------------------------------------------------------+

johto84

Pipould's a écrit :


 
 
Si tu fais du tensor split faut se mefier. 4x chipset c'est pas ouf, apres ca depend de la gen aussi.  
 
Je ne sais pas si la 70ti apporte bcp plus, l'important est la bande passante memoire.  


 

ibuprophet a écrit :


Si tu peux éviter le dual-gpu, c'est toujours mieux. De base avec 2 GPUs identiques en PCIe 8x/8x, 1+1 = 0.8 en perf grosso-modo. Le calcul du pipeline est séquentiel, le PCIe x4 ne va pas te brider des masses. Transfert d'un gpu à l'autre, 3s max.


 
 
La 70ti a 2 fois plus de bande passante que la 60ti, c'est ce que je cherche a savoir sur le x4, apparemment sa serait 8go/s mais je sais pas trop si sa peut poser un real problème ou pas.  
 
car en gros dans un des cas je doit juste changer la CM et dans l'autre jdois prendre DDR5 + CM 8x 8x sa commence a piquer  
 
Et malheureusement j'ai pas la chance d'avoir une 5090 donc le double GPU est obligatoire pour avoir les 32go.  
 
Je veut pas utiliser le Pipeline mais plutôt en tensor, les gain c'est quasi du simple au double il me semble en terme de token/s

Pipould's

Tronklou a écrit :

Propre le boitier imprimé !
 
Un lien vers le projet ou le fil de discussion ? ca m’intéresse grandement :D


 
Pour le coup les 3090 moulinent vraiment mieux que le strix  :cry:  
 
Il faudrait un qwen 3.8 122b pour mettre le strix en plan et les 3090 en coding...  
 
Mais la df4 flash lite... mama... trop lent...

Pipould's

Tronklou a écrit :

Propre le boitier imprimé !
 
Un lien vers le projet ou le fil de discussion ? ca m’intéresse grandement :D


 
https://makerworld.com/en/models/24 [...] -80mm-fans

Tronklou Propre le boitier imprimé !
 
Un lien vers le projet ou le fil de discussion ? ca m’intéresse grandement :D
Pipould's Voici la photo de famille de mon barbecue / server d'inference:
 
https://i.ibb.co/gbqRFqyc/IMG-20260810-182729.jpg
ibuprophet

johto84 a écrit :

Salut a tous, quelqu'un a une config en double gpu ici ? si oui j'aimerai savoir quel CM vous utiliser, de ce que j'ai vu le top est d'avoir du 8x 8x mais je sais pas si un 16x cpu + 4x chipset c'est ok ou ça va bcp trop brider ?  
 
J'ai une 5070ti et je veut rajouter une 5060ti 16go pour être tranquille sur du 27b.  
 
Je sais que a 50/50 32go y'a rien a faire la 70ti va être brider mais je penser faire quelque chose comme 60/40 pour tourner dans les 28go et profiter de la puissance de la 70ti un peut plus


Si tu peux éviter le dual-gpu, c'est toujours mieux. De base avec 2 GPUs identiques en PCIe 8x/8x, 1+1 = 0.8 en perf grosso-modo. Le calcul du pipeline est séquentiel, le PCIe x4 ne va pas te brider des masses. Transfert d'un gpu à l'autre, 3s max.

Pipould's

johto84 a écrit :

Salut a tous, quelqu'un a une config en double gpu ici ? si oui j'aimerai savoir quel CM vous utiliser, de ce que j'ai vu le top est d'avoir du 8x 8x mais je sais pas si un 16x cpu + 4x chipset c'est ok ou ça va bcp trop brider ?  
 
J'ai une 5070ti et je veut rajouter une 5060ti 16go pour être tranquille sur du 27b.  
 
Je sais que a 50/50 32go y'a rien a faire la 70ti va être brider mais je penser faire quelque chose comme 60/40 pour tourner dans les 28go et profiter de la puissance de la 70ti un peut plus


 
 
Si tu fais du tensor split faut se mefier. 4x chipset c'est pas ouf, apres ca depend de la gen aussi.  
 
Je ne sais pas si la 70ti apporte bcp plus, l'important est la bande passante memoire.  

the_fennec


 
J'aurais du prendre une photo avec ma 4060Ti et la GTX 1650 Super  [:meilleur_habit:4]

the_fennec Colibrì vs llama.cpp: Running DeepSeek V4 284B on CPU
https://www.youtube.com/watch?v=pIN-2oVJpyU
 
Codacus teste Colibrì :love:
Il explique bien ce gars et en plus il trouve des flags utiles dans llama.cpp: -nr (No Repack) je pense que c'est pour ça que j'arrive pas a charger DS4!
 
edit: pas mieux pour -nr :(
johto84 Salut a tous, quelqu'un a une config en double gpu ici ? si oui j'aimerai savoir quel CM vous utiliser, de ce que j'ai vu le top est d'avoir du 8x 8x mais je sais pas si un 16x cpu + 4x chipset c'est ok ou ça va bcp trop brider ?  
 
J'ai une 5070ti et je veut rajouter une 5060ti 16go pour être tranquille sur du 27b.  
 
Je sais que a 50/50 32go y'a rien a faire la 70ti va être brider mais je penser faire quelque chose comme 60/40 pour tourner dans les 28go et profiter de la puissance de la 70ti un peut plus
Tronklou Le choc des générations https://rehost.diberie.com/Picture/Get/r/535135
the_fennec C'est DL je testerais ce soir.
Tronklou Je branche la 3060 et je test :D
Olivie qui teste ? :o
 

Citation :

@UnslothAI
 
2-bit Muse Glimmer GGUF managed to call 100+ tools on just 14GB RAM.  
 
Muse Glimmer did a complete repo bug hunt for 5 mins nonstop with: evidence, repro, fix, tests and a PR writeup.
 
Run and train it in Unsloth.
 
GitHub repo: https://github.com/unslothai/unsloth

the_fennec C'est bien un peu de concurrence... mais on dirait que Qwen 3.6 est toujours le roi du code, enfin jusqu’à mercredi :o
Olivie https://img3.super-h.fr/images/2026 [...] 178878.jpg  
https://img3.super-h.fr/images/2026 [...] 855131.jpg  
https://img3.super-h.fr/images/2026 [...] 474227.jpg  
 
https://huggingface.co/meta-models
the_fennec Je trouve pi seul trop limité, little-coder est bien.
Pipould's D'ailleurs, est-ce que vous avez un bon harness complet avec pi ? :-)  
the_fennec

Tronklou a écrit :

J'ai pensé a toi the_fennec en voyant cet agent spécialement concus pour les longs travaux en local : https://github.com/PrimeIntellect-ai/prime-agent
 
Les premiers retour ont l'air très bon :D


 
:jap: je l'ai vu passé sur Reddit, mais ça parle pas de modèle local donc ça doit être un gouffre a contexte :o
Je testerais a l'occasion.
 
Pour l'instant j'ai rien a reprocher a little-coder, si ce n'est d'être basé sur pi et d'avoir une doc "LLM" aka de merde :o
Dans le README ils expliquent comment faire la config, mais en réalité ça marche pas, pi trouve sa propre config dans ~/.pi/agent/ ...
 
Et aussi il se foire sur la compaction des fois, mais je comprends pas trop ce qui ne va pas.

neo world Pour ceux qui on du PCI express gen 5 et veulent donner toutes ses chances à K3 en mode colibri :
www.dealabs.com/bons-plans/ssd-gen [...] os-3388645
 
Bordel ils supportent le streaming sur deux SSD en simultané :
https://github.com/JustVugg/colibri [...] -bandwidth
 
J'ai un 2To à aller chercher sur mon routeur (me demandez pas ce qui m'a pris. on peut tous faire des mauvais choix :o) à remplacer par le NVME qui venait avec mon ancien laptop (un vénérable 1to qui valait pas grand chose à l'époque mais qui me paiera peut être des vacances si je le garde assez longtemps :o) pour jouer :love:
Tronklou J'ai pensé a toi the_fennec en voyant cet agent spécialement concus pour les longs travaux en local : https://github.com/PrimeIntellect-ai/prime-agent
 
Les premiers retour ont l'air très bon :D
moyen_moins faudra que j'essaie quand je rentrerai :jap:
the_fennec

moyen_moins a écrit :


J'ai le 3.6 35B qui reste pas mal (par exemple avec le mcp home assistant) et où je peux coller 128k de contexte et des perfs correctes mais moins bon pour certains trucs (et il boucle vite je trouve par exemple avec opencode).


 
Je trouve que opencode est vraiment mauvais de ce coté maintenant en local, au point que je suis passé sur claude-code, puis finalement sur little-coder.

the_fennec \o/
 
C'est un bug dans Mesa! J'étais en 26.2.0~rc3 je suis repassé en 26.1.5-1 et tout remarche [:le_max].
J'irais ouvrir un bug/voter plus tard...
 
J'ai upgrade sans faire gaffe pour changer les IP des cartes USBs en installant network-manager (la flemme :D)
 
Au passage je vois que bc250-cu-live-manager gère l'unlock CPU aussi. J'ai remis 40cu, j'avais testé avec 24 au kazou :o
https://github.com/WinnieLV/bc250-cu-live-manager
moyen_moins J'ai fini par prendre 10 balles chez deepseek et en V4 flash, ça part pas bien vite en effet :)
Mais bon, mon côté geek et me dire que "tout ça", ça vient de mon matos :D

 

edit: aux possesseurs de strix halo, vous avez testé les modèles quantized rocmfpx , y'a un gain réel et pas simplement bench ?

Tronklou Le mieux si tu peux c'est d'avoir une machine dédiée sous linux, avec llama.cpp

 

Pour le côté rat : DeepSeek v4 flash coûte presque rien, toujours moins que de racheter du matos.
Et au pire les quotas gratuits de GPT sont gargantuesque

moyen_moins J'ai l'impression que c'est plus pour gérer les écrans que ça prend 1-2Go de VRAM.
Mais c'est vrai que par défaut, mmap reste actif dans lmstudio il me semble mais je pensais que c'était surtout utile pour le démarrage/chargement du modèle [:paysan]
Sinon j'ai testé en rajoutant une 3eme carte (10GB de VRAM) mais j'ai pas l'impression que ça a amélioré les perfs globalement. De toute façon, je suis limité par la plateforme AM4 au niveau pcie.
 
J'utilise beaucoup le qwen 3.6 27B Q6 pour tester des idées pour avoir de bons 1er jets (gros rat inside, quand je peux je claque pas opencode go pour des petits trucs à tester) mais je passe pas les 64k de contexte avec le kv cache en q8 :/
 
J'ai le 3.6 35B qui reste pas mal (par exemple avec le mcp home assistant) et où je peux coller 128k de contexte et des perfs correctes mais moins bon pour certains trucs (et il boucle vite je trouve par exemple avec opencode).
Tronklou

neo world a écrit :


 :love: Bon je sais pas quelles performances tu en attends vs tes BC250 :o

 

Pour du gros model en déchargement ram + un gpu 12/16gb.
L'idée c'est d'avoir un agent performant qui fait du contrôle la nuit de ce qui a été fait le jour par le reste de mon workflow.
Du coup même si c'est lent c'est pas grave vu qu'il a environ 8h devant lui pour faire le boulot.

Tronklou

moyen_moins a écrit :


je débarque surement (en plus d'être un noob) mais tes bc250 avec 16GB, t'arrives à les connecter de manière efficace pour faire de l'inférence ?
j'ai 2 cg 16GB dans ma relativement vieille config mais j'arrive rarement à dépasser du Q6 sur du 27B avec un contexte intéressant, y'a toujours une partie de la RAM de la CG principale qu'on peut pas toucher (sous windows) j'ai l'impression.;
j'ai toujours des doutes sur les version Q4 sur des "petits" modèles, j'ai été déçu quelques fois (après, je fais ça plus par geekerie qu'autre chose mais j'aime l'idée de tout pouvoir faire en local) :o

 

Je ne vise pas des modèles aussi gros.
Enfaite moi j'ai besoins de faire de la parallélisation dans mon usage, traitement ocr sur d'énormes batch, traduction, synthèse...

 

Que des choses légères mais chronophage.
Donc avoir plusieurs server llm indépendants c'est super pratique car ça me permet soit d'aller vite sur un dossier ciblé en mettant toutes les ressources dessus, ou au contraire de laisser tourner en fond sur une tâche longue durée pendant que les autres sont libres.

 

Avant de vouloir investir il faut faut absolument déterminer ton usage.
Mon angle d'utilisation est vraiment extrêmement niche, par chance ça colle parfaitement avec du local avec peu de vram, mais sinon je n'aurais même pas acheté de bc250

 

the_fennec

Tronklou a écrit :

Force avec tes galères, perso les bc250 sont rockstables, je n'y touche plus :O
 
J'ai chopé 128gb de lrdimm en ddr3, reste a chiner une cm de workstation apachere :D


 
Merci! De mon coté je chercher 2x16gb de DDR4 en 3200, mais c'est juste abusé les tarifs :( J'attends la fin du rampocalypse comme tout le monde ...
 

moyen_moins a écrit :

 
je débarque surement (en plus d'être un noob) mais tes bc250 avec 16GB, t'arrives à les connecter de manière efficace pour faire de l'inférence ?
j'ai 2 cg 16GB dans ma relativement vieille config mais j'arrive rarement à dépasser du Q6 sur du 27B avec un contexte intéressant, y'a toujours une partie de la RAM de la CG principale qu'on peut pas toucher (sous windows) j'ai l'impression.;
j'ai toujours des doutes sur les version Q4 sur des "petits" modèles, j'ai été déçu quelques fois (après, je fais ça plus par geekerie qu'autre chose mais j'aime l'idée de tout pouvoir faire en local) :o


 
J'ai deux BC250 et une RTX 4060Ti 16GB et je peux (pouvais) utiliser Qwen 27B Q8 MTP avec 256K de contexte. Après j'ai dans les 100/s en prefil et 8/10/s en tg avec llama.cpp en RPC.
Si tu as déjà une BC250 tu peux l'ajouter, sinon elle sont chères maintenant :(
 
Pour ta RAM t'as essayé en désactivant mmap?

moyen_moins

Tronklou a écrit :

Force avec tes galères, perso les bc250 sont rockstables, je n'y touche plus :O
 
J'ai chopé 128gb de lrdimm en ddr3, reste a chiner une cm de workstation apachere :D

 
je débarque surement (en plus d'être un noob) mais tes bc250 avec 16GB, t'arrives à les connecter de manière efficace pour faire de l'inférence ?
j'ai 2 cg 16GB dans ma relativement vieille config mais j'arrive rarement à dépasser du Q6 sur du 27B avec un contexte intéressant, y'a toujours une partie de la RAM de la CG principale qu'on peut pas toucher (sous windows) j'ai l'impression.;
j'ai toujours des doutes sur les version Q4 sur des "petits" modèles, j'ai été déçu quelques fois (après, je fais ça plus par geekerie qu'autre chose mais j'aime l'idée de tout pouvoir faire en local) :o

neo world

Tronklou a écrit :

Force avec tes galères, perso les bc250 sont rockstables, je n'y touche plus :O
 
J'ai chopé 128gb de lrdimm en ddr3, reste a chiner une cm de workstation apachere :D


 :love: Bon je sais pas quelles performances tu en attends vs tes BC250 :o

Tronklou Force avec tes galères, perso les bc250 sont rockstables, je n'y touche plus :O
 
J'ai chopé 128gb de lrdimm en ddr3, reste a chiner une cm de workstation apachere :D
the_fennec Merci, mais c'est bon, j'en ai deux en 2.5g :jap:
 
J'ai pris une autre carte pcie usb en chipset Fresco Logic FL1100 pour voir si ça me permet de remettre le deuxième GPU. Je verrais plus tard pour le réseau.

Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)