| |||||
| Dernière réponse | |
|---|---|
| Sujet : Infra IA : aide au choix et troubleshot de LLM Locaux | |
| neo world | tu as mis combien en context ? il a pas juste fait un oom (crash du modèle) ou simplement dépassé son context (j'imagine que ça interompt seulement ce qu'il y avait en cours) |
| Aperçu |
|---|
| Vue Rapide de la discussion |
|---|
| johto84 |
|
| johto84 |
|
| the_fennec |
|
| Pipould's |
|
| the_fennec |
|
| ibuprophet | Ceci dit, avec la pénurie de composants qui s'annonce, tu ne risques pas trop de perte à tester |
| Pipould's |
|
| johto84 |
|
| Pipould's |
|
| Pipould's |
|
| Tronklou | Propre le boitier imprimé !
Un lien vers le projet ou le fil de discussion ? ca m’intéresse grandement :D |
| Pipould's | Voici la photo de famille de mon barbecue / server d'inference:
https://i.ibb.co/gbqRFqyc/IMG-20260810-182729.jpg |
| ibuprophet |
|
| Pipould's |
|
| the_fennec |
|
| the_fennec | Colibrì vs llama.cpp: Running DeepSeek V4 284B on CPU
https://www.youtube.com/watch?v=pIN-2oVJpyU Codacus teste Colibrì :love: Il explique bien ce gars et en plus il trouve des flags utiles dans llama.cpp: -nr (No Repack) je pense que c'est pour ça que j'arrive pas a charger DS4! edit: pas mieux pour -nr :( |
| johto84 | Salut a tous, quelqu'un a une config en double gpu ici ? si oui j'aimerai savoir quel CM vous utiliser, de ce que j'ai vu le top est d'avoir du 8x 8x mais je sais pas si un 16x cpu + 4x chipset c'est ok ou ça va bcp trop brider ? J'ai une 5070ti et je veut rajouter une 5060ti 16go pour être tranquille sur du 27b. Je sais que a 50/50 32go y'a rien a faire la 70ti va être brider mais je penser faire quelque chose comme 60/40 pour tourner dans les 28go et profiter de la puissance de la 70ti un peut plus |
| Tronklou | Le choc des générations https://rehost.diberie.com/Picture/Get/r/535135 |
| the_fennec | C'est DL je testerais ce soir. |
| Tronklou | Je branche la 3060 et je test :D |
| Olivie | qui teste ? :o
|
| the_fennec | C'est bien un peu de concurrence... mais on dirait que Qwen 3.6 est toujours le roi du code, enfin jusqu’à mercredi :o |
| the_fennec | Je trouve pi seul trop limité, little-coder est bien. |
| Pipould's | D'ailleurs, est-ce que vous avez un bon harness complet avec pi ? :-) |
| the_fennec |
|
| neo world | Pour ceux qui on du PCI express gen 5 et veulent donner toutes ses chances à K3 en mode colibri :
www.dealabs.com/bons-plans/ssd-gen [...] os-3388645 Bordel ils supportent le streaming sur deux SSD en simultané : https://github.com/JustVugg/colibri [...] -bandwidth J'ai un 2To à aller chercher sur mon routeur (me demandez pas ce qui m'a pris. on peut tous faire des mauvais choix :o) à remplacer par le NVME qui venait avec mon ancien laptop (un vénérable 1to qui valait pas grand chose à l'époque mais qui me paiera peut être des vacances si je le garde assez longtemps :o) pour jouer :love: |
| Tronklou | J'ai pensé a toi the_fennec en voyant cet agent spécialement concus pour les longs travaux en local : https://github.com/PrimeIntellect-ai/prime-agent
Les premiers retour ont l'air très bon :D |
| moyen_moins | faudra que j'essaie quand je rentrerai :jap: |
| the_fennec |
|
| the_fennec | \o/
C'est un bug dans Mesa! J'étais en 26.2.0~rc3 je suis repassé en 26.1.5-1 et tout remarche [:le_max]. J'irais ouvrir un bug/voter plus tard... J'ai upgrade sans faire gaffe pour changer les IP des cartes USBs en installant network-manager (la flemme :D) Au passage je vois que bc250-cu-live-manager gère l'unlock CPU aussi. J'ai remis 40cu, j'avais testé avec 24 au kazou :o https://github.com/WinnieLV/bc250-cu-live-manager |
| moyen_moins | J'ai fini par prendre 10 balles chez deepseek et en V4 flash, ça part pas bien vite en effet :) Mais bon, mon côté geek et me dire que "tout ça", ça vient de mon matos :D edit: aux possesseurs de strix halo, vous avez testé les modèles quantized rocmfpx , y'a un gain réel et pas simplement bench ? |
| Tronklou | Le mieux si tu peux c'est d'avoir une machine dédiée sous linux, avec llama.cpp Pour le côté rat : DeepSeek v4 flash coûte presque rien, toujours moins que de racheter du matos. |
| moyen_moins | J'ai l'impression que c'est plus pour gérer les écrans que ça prend 1-2Go de VRAM.
Mais c'est vrai que par défaut, mmap reste actif dans lmstudio il me semble mais je pensais que c'était surtout utile pour le démarrage/chargement du modèle [:paysan] Sinon j'ai testé en rajoutant une 3eme carte (10GB de VRAM) mais j'ai pas l'impression que ça a amélioré les perfs globalement. De toute façon, je suis limité par la plateforme AM4 au niveau pcie. J'utilise beaucoup le qwen 3.6 27B Q6 pour tester des idées pour avoir de bons 1er jets (gros rat inside, quand je peux je claque pas opencode go pour des petits trucs à tester) mais je passe pas les 64k de contexte avec le kv cache en q8 :/ J'ai le 3.6 35B qui reste pas mal (par exemple avec le mcp home assistant) et où je peux coller 128k de contexte et des perfs correctes mais moins bon pour certains trucs (et il boucle vite je trouve par exemple avec opencode). |
| Tronklou |
Pour du gros model en déchargement ram + un gpu 12/16gb. |
| Tronklou |
Je ne vise pas des modèles aussi gros. Que des choses légères mais chronophage. Avant de vouloir investir il faut faut absolument déterminer ton usage. |
| the_fennec |
|
| moyen_moins |
|
| neo world |
|
| Tronklou | Force avec tes galères, perso les bc250 sont rockstables, je n'y touche plus :O
J'ai chopé 128gb de lrdimm en ddr3, reste a chiner une cm de workstation apachere :D |
| the_fennec | Merci, mais c'est bon, j'en ai deux en 2.5g :jap:
J'ai pris une autre carte pcie usb en chipset Fresco Logic FL1100 pour voir si ça me permet de remettre le deuxième GPU. Je verrais plus tard pour le réseau. |




