| |||||
| Auteur | Sujet : Infra IA : aide au choix et troubleshot de LLM Locaux |
|---|---|
neo world | Reprise du message précédent : |
neo world |
Plam Bear Metal |
2x spark et c'est ok-ish. --------------- Spécialiste du bear metal |
Jules Winnfield порой не та... | BC250 à 140€ sur ali pour les intéressés |
the_fennec f3nn3cUs z3rd4 | C'est bon je suis équipé --------------- Faudra que je teste un jour :o |
neo world | c'est même pas le prix de la gddr qui l'équipe ^^ |
extenue1 | Un peu HS mais qqun aurait un article ou video montrant quoi acheter d'autre pour se monter un PC entier autour de cette carte ? |
neo world | Ajoute ça à tes signets : https://github.com/akandr/bc250
|
the_fennec f3nn3cUs z3rd4 |
--------------- Faudra que je teste un jour :o |
the_fennec f3nn3cUs z3rd4 | D'ailleurs un unlock des 2 cores CPU manquant est sortis, mais j'ai pas testé:
--------------- Faudra que je teste un jour :o |
AllenMadison Oracle du Keb's |
--------------- Nothing much to teach, man. There's ze high, there's ze low and yall still fucking miss. |
neo world | T’avais aussi une vidéo pour la partie optimisation / overclocking / case qui est dans le descriptif de dealabs :
|
neo world | Si vous avez au moins 2To de NVME :
Message édité par neo world le 01-08-2026 à 17:50:45 |
the_fennec f3nn3cUs z3rd4 |
neo world |
Message cité 1 fois Message édité par neo world le 01-08-2026 à 22:04:05 |
neo world |
|
M300A |
Message édité par M300A le 01-08-2026 à 22:13:11 --------------- :wq |
neo world | ça me parait léger (enfin façon de parler vu la bestiole |
M300A |
Par exemple:
Ca tourne avec https://github.com/local-inference- [...] ark-v20.md car apparemment c'est pas supporté encore de base correctement dans VLLM Message édité par M300A le 01-08-2026 à 22:34:31 --------------- :wq |
the_fennec f3nn3cUs z3rd4 |
--------------- Faudra que je teste un jour :o |
neo world | Tu veux peut être retirer ce qu'il y a derrière root@ ? |
neo world | moi ça me semble carré. A ta place j'activerai l'autoboost mais il me semble pas que ça accélère la fréquence du HBM donc pas sur que tu en tireras plus de jus.
|
neo world |
|
M300A | Oui j'ai viré le hostname mais bon rien de très secret encore une fois Oé j'ai quand même bien galéré, comme d'hab, le KVM ipmi avec la moitié des touches qui marchent pas, nouveau qui me fait des kernels oops sur les blackwell sur le host et quo empêche systemd-udevd de démarrer : réseau qui monte pas au boot, et j'ai du me taper une self formation express sur les gros switch alcatel que je connais pas (ça fonctionne même pas en vlan c'est un truc propriétaire de chez eux). Pas mal galéré aussi pour pré-charger le model depuis hugginface sur le host pour que le modèle le trouve dans le cache monté dans le docker et essaye pas d'aller sur le net (proxy...) Et après j'ai bidouillé des params kernels car les cartes communiquaient pas entre elles et le chargement du modèle prenait des heures. Ca c'est opus qui a debuggé mais il y a une commande nvidia-smi qui affiche une matrice de communication entre les GPUs c'était pas si compliqué, une fois que le problème était identifié Je suis content quand même Maintenant ça serait pas mal que je trouve une interface Web façon chat bot à coller dessus. Une idée ? Message édité par M300A le 01-08-2026 à 22:42:12 --------------- :wq |
neo world | vllm pousse vers open WebUI :
|
neo world | Bordel je découvre que Alcatel fait toujours des Switchs. Le dernier que j'ai vu en entreprise c'était un hub 10Mb/s sur lequel on pouvait monter en ethernet ou en BNC (le truc était déjà décommissionné et prêt à être bazardé à mon premier jour |
M300A | Mieux non ?
--------------- :wq |
neo world |
M300A |
Essentiellement iommu=pt sur le host, c'est ce qui a fait le gros gain. Après un tweak sur les channels NCCL qui à apporté un petit gain sur le temps de chargement du modèle donc je pense que ça peut pas faire de mal et du pinning numa sur la VM mais pas de gain visible. Je suis pas sûr que je vais pouvoir faire mieux, c'est déjà très sympa par rapport à la lenteur de Claude Message édité par M300A le 02-08-2026 à 01:43:46 --------------- :wq |
neo world | |
M300A | Assez --------------- :wq |
Plam Bear Metal | C'est le bon combo, vLLM + OpenWebUI (ici on a aussi un LiteLLM au milieu ça permet d'avoir un « middleware » pour router comme on veut).
--------------- Spécialiste du bear metal |
Nr13 | j'ai une question à moitié LLM local. |
the_fennec f3nn3cUs z3rd4 |
--------------- Faudra que je teste un jour :o |
Plam Bear Metal |
--------------- Spécialiste du bear metal |
M300A |
Plam Bear Metal |
--------------- Spécialiste du bear metal |
M300A | En tout cas je bricole avec le Ds5 Flash 0731 c'est de la folie, ca marche vraiment bien et la vitesse est vraiment cool --------------- :wq |
Plam Bear Metal |
--------------- Spécialiste du bear metal |
Nr13 | Merci pour les infos sur litellm, ça pourrait correspondre.
|

| Sujets relatifs | |
|---|---|
| [Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & co | sécurité de l'IA / agentique et des Devs en roue libre |
| Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux | |




