Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
4602 connectés 

 


Dernière réponse
Sujet : Infra IA : aide au choix et troubleshot de LLM Locaux
Jules Winnfield

neo world a écrit :


Certes ce qui fait gagner 15 minutes et évite le bordel de coller un ecran plat magnétique à la porte et passer les câbles. J'en installerait forcément un à un moment :D


 
Et puis, tu n'auras pas de mal à trouver un port ethernet dispo pour le brancher :D  


Votre réponse
Nom d'utilisateur    Pour poster, vous devez être inscrit sur ce forum .... si ce n'est pas le cas, cliquez ici !
Le ton de votre message                        
                       
Votre réponse


[b][i][u][strike][spoiler][fixed][cpp][url][email][img][*]   
 
   [quote]
 

Options

 
Vous avez perdu votre mot de passe ?


Vue Rapide de la discussion
Jules Winnfield

neo world a écrit :


Certes ce qui fait gagner 15 minutes et évite le bordel de coller un ecran plat magnétique à la porte et passer les câbles. J'en installerait forcément un à un moment :D


 
Et puis, tu n'auras pas de mal à trouver un port ethernet dispo pour le brancher :D  

neo world

LaRoueEstTombee a écrit :


Mais avec ça, plus besoin d'aller à la baie :o


Certes ce qui fait gagner 15 minutes et évite le bordel de coller un ecran plat magnétique à la porte et passer les câbles. J'en installerait forcément un à un moment :D

neo world

ionik a écrit :


Je pensais qu'on pouvait monter a plus de 100go sur le GPU sur Linux et oui forcément le réseau serait un frein a la vitesse mais il me semblais qu'il y avait un truc pour optimiser cela.


C'est le cas sur les AMD AI Strix Halo. Le conseil c'est de remonter la taille de la VRAM à 124GO adressable (  :love:  )
sur les autres gammes ryzen c'est beaucoup moins souple :jap:

LaRoueEstTombee

neo world a écrit :


ça dépasse le simple fait de mettre une clé USB et un ecran portable : faut tout reconfigurer à chaque remasterisation  :pt1cable:


Mais avec ça, plus besoin d'aller à la baie :o

ionik

neo world a écrit :


Ce serait incroyablement inefficace réseau 2 X 2,5Gb et que de la RAM classique pas intégralement accessible au GPU  :whistle:


Je pensais qu'on pouvait monter a plus de 100go sur le GPU sur Linux et oui forcément le réseau serait un frein a la vitesse mais il me semblais qu'il y avait un truc pour optimiser cela.

neo world

phardfr a écrit :


 :love:  :love:  :love:  
Laisse-moi ton adresse, je vais te débarrasser de quelques trucs. (Promis, je te laisse la freebox et le lave-vaiselle..  :lol: )
En tout cas, c'est beau....


merci !
 
après tous ces mois de négligence du sommeil il faudra aussi m'embarquer avec les machines. Je peux prendre le lave vaisselle en même temps s'tu veux :o

neo world

ionik a écrit :


Ha je pensais que c'était une usine de machine pour inference en réseaux  :O


Ce serait incroyablement inefficace réseau 2 X 2,5Gb et que de la RAM classique pas intégralement accessible au GPU  :whistle:

ionik

neo world a écrit :


Le cluster Ryzen ne fait que de l'hebergement de VM (cluster proxmox). J'avais au depart fait une synchronization des disques via CEPH mais ça faisait perdre les deux tiers du stockage donc je suis reparti sur du backup classique :jap:

 

Les agents appellent le Strix Halo pour la génération de tokens :jap:


Ha je pensais que c'était une usine de machine pour inference en réseaux  :O

phardfr

neo world a écrit :

Bon c'est pas fini encore mais j'avais promis du hardware porn et time is running out  [:petit larousse]   :o
 
https://rehost.diberie.com/Picture/Get/f/534363


 :love:  :love:  :love:  
Laisse-moi ton adresse, je vais te débarrasser de quelques trucs. (Promis, je te laisse la freebox et le lave-vaiselle..  :lol: )
En tout cas, c'est beau....

neo world


ça dépasse le simple fait de mettre une clé USB et un ecran portable : faut tout reconfigurer à chaque remasterisation  :pt1cable:

neo world

ionik a écrit :


Tu organise comment ton cluster de Ryzen ? Tu arrives à mutualiser la mémoire via le réseau? Ça rame pas trop ?


Le cluster Ryzen ne fait que de l'hebergement de VM (cluster proxmox). J'avais au depart fait une synchronization des disques via CEPH mais ça faisait perdre les deux tiers du stockage donc je suis reparti sur du backup classique :jap:
 
Les agents appellent le Strix Halo pour la génération de tokens :jap:

neo world

M300A a écrit :


...
[:so-saugrenu4:7]


Ca compute fort je vois :love:

LaRoueEstTombee

neo world a écrit :

../..  
=> Le AMD AI Strix halo. Pour l'instant il clignote en se tournant les pouces (le temps que je mette en place un backup automatique de tout le système pour facilement tout peter et tester des trucs plus ou moins expérimentaux sans devoir aller à la baie tout réinstaller comme ça m'est arrivé 5 ou 6 fois. La dernière fois étant y'a deux heures  :lol:
 ../..  


PiKVM [:stephan_lapaix]

ionik

neo world a écrit :

tu dis ça à cause de la finition RGB chique et choc ? :o

 

mais sinon ouais la machine prend 100€ régulièrement mais on est loin des 6k :
https://www.bosgamepc.com/products/ [...] ai-max-395

 

Là j'en ai pour environ 8500 balles en comptant large avec les autres équipements réseau de la maison, les cables et les 96GB de RAM pour le NAS toujours pas arrivés depuis deux mois maintenant [:gaellamonf:5]


Tu organise comment ton cluster de Ryzen ? Tu arrives à mutualiser la mémoire via le réseau? Ça rame pas trop ?

the_fennec

neo world a écrit :

tu dis ça à cause de la finition RGB chique et choc ? :o
 
mais sinon ouais la machine prend 100€ régulièrement mais on est loin des 6k :
https://www.bosgamepc.com/products/ [...] ai-max-395
 
Là j'en ai pour environ 8500 balles en comptant large avec les autres équipements réseau de la maison, les cables et les 96GB de RAM pour le NAS toujours pas arrivés depuis deux mois maintenant [:gaellamonf:5]


 
Effectivement, j'aurais pas du croire ce que j'ai lu sur Reddit :lol:

M300A

Citation :


(APIServer pid=7) INFO 08-06 21:13:34 [loggers.py:314] Engine 000: Avg prompt throughput: 3616.3 tokens/s, Avg generation throughput: 230.2 tokens/s, Running: 3 reqs, Waiting: 0 reqs, GPU KV cache usage: 13.5%, Prefix cache hit rate: 85.8%
(APIServer pid=7) INFO 08-06 21:13:44 [loggers.py:314] Engine 000: Avg prompt throughput: 6401.0 tokens/s, Avg generation throughput: 269.2 tokens/s, Running: 4 reqs, Waiting: 0 reqs, GPU KV cache usage: 8.4%, Prefix cache hit rate: 81.0%
(APIServer pid=7) INFO 08-06 21:13:54 [loggers.py:314] Engine 000: Avg prompt throughput: 6874.1 tokens/s, Avg generation throughput: 344.6 tokens/s, Running: 5 reqs, Waiting: 0 reqs, GPU KV cache usage: 2.0%, Prefix cache hit rate: 80.3%
(APIServer pid=7) INFO 08-06 21:14:04 [loggers.py:314] Engine 000: Avg prompt throughput: 1806.3 tokens/s, Avg generation throughput: 635.8 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 2.0%, Prefix cache hit rate: 79.6%
(APIServer pid=7) INFO 08-06 21:14:14 [loggers.py:314] Engine 000: Avg prompt throughput: 2983.9 tokens/s, Avg generation throughput: 590.4 tokens/s, Running: 5 reqs, Waiting: 0 reqs, GPU KV cache usage: 9.1%, Prefix cache hit rate: 78.6%
(APIServer pid=7) INFO 08-06 21:14:24 [loggers.py:314] Engine 000: Avg prompt throughput: 6983.7 tokens/s, Avg generation throughput: 409.5 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 2.8%, Prefix cache hit rate: 77.6%
(APIServer pid=7) INFO 08-06 21:14:34 [loggers.py:314] Engine 000: Avg prompt throughput: 2550.8 tokens/s, Avg generation throughput: 609.9 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 14.8%, Prefix cache hit rate: 77.7%
(APIServer pid=7) INFO 08-06 21:14:44 [loggers.py:314] Engine 000: Avg prompt throughput: 6635.8 tokens/s, Avg generation throughput: 387.1 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 3.6%, Prefix cache hit rate: 77.7%
(APIServer pid=7) INFO 08-06 21:14:54 [loggers.py:314] Engine 000: Avg prompt throughput: 3148.5 tokens/s, Avg generation throughput: 547.7 tokens/s, Running: 5 reqs, Waiting: 0 reqs, GPU KV cache usage: 8.9%, Prefix cache hit rate: 78.6%
(APIServer pid=7) INFO 08-06 21:15:04 [loggers.py:314] Engine 000: Avg prompt throughput: 6454.2 tokens/s, Avg generation throughput: 341.4 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 4.4%, Prefix cache hit rate: 79.7%
(APIServer pid=7) INFO 08-06 21:15:14 [loggers.py:314] Engine 000: Avg prompt throughput: 4481.4 tokens/s, Avg generation throughput: 436.5 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 4.7%, Prefix cache hit rate: 81.0%
(APIServer pid=7) INFO 08-06 21:15:24 [loggers.py:314] Engine 000: Avg prompt throughput: 6621.5 tokens/s, Avg generation throughput: 313.8 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 12.3%, Prefix cache hit rate: 81.7%
(APIServer pid=7) INFO 08-06 21:15:34 [loggers.py:314] Engine 000: Avg prompt throughput: 3559.2 tokens/s, Avg generation throughput: 500.9 tokens/s, Running: 5 reqs, Waiting: 0 reqs, GPU KV cache usage: 4.3%, Prefix cache hit rate: 82.4%
(APIServer pid=7) INFO 08-06 21:15:44 [loggers.py:314] Engine 000: Avg prompt throughput: 3410.1 tokens/s, Avg generation throughput: 475.3 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 5.9%, Prefix cache hit rate: 83.1%
(APIServer pid=7) INFO 08-06 21:15:54 [loggers.py:314] Engine 000: Avg prompt throughput: 3726.1 tokens/s, Avg generation throughput: 390.2 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 13.9%, Prefix cache hit rate: 84.6%
(APIServer pid=7) INFO 08-06 21:16:04 [loggers.py:314] Engine 000: Avg prompt throughput: 3019.7 tokens/s, Avg generation throughput: 469.9 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 6.4%, Prefix cache hit rate: 85.5%
(APIServer pid=7) INFO 08-06 21:16:14 [loggers.py:314] Engine 000: Avg prompt throughput: 2217.1 tokens/s, Avg generation throughput: 516.1 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 11.6%, Prefix cache hit rate: 86.3%
(APIServer pid=7) INFO 08-06 21:16:24 [loggers.py:314] Engine 000: Avg prompt throughput: 3700.4 tokens/s, Avg generation throughput: 463.2 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 6.9%, Prefix cache hit rate: 86.8%
(APIServer pid=7) INFO 08-06 21:16:34 [loggers.py:314] Engine 000: Avg prompt throughput: 3148.0 tokens/s, Avg generation throughput: 420.8 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 11.6%, Prefix cache hit rate: 88.4%
(APIServer pid=7) INFO 08-06 21:16:44 [loggers.py:314] Engine 000: Avg prompt throughput: 2458.1 tokens/s, Avg generation throughput: 520.8 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.4%, Prefix cache hit rate: 88.8%
(APIServer pid=7) INFO 08-06 21:16:54 [loggers.py:314] Engine 000: Avg prompt throughput: 1182.8 tokens/s, Avg generation throughput: 555.1 tokens/s, Running: 5 reqs, Waiting: 0 reqs, GPU KV cache usage: 6.4%, Prefix cache hit rate: 89.3%
(APIServer pid=7) INFO 08-06 21:17:04 [loggers.py:314] Engine 000: Avg prompt throughput: 2243.0 tokens/s, Avg generation throughput: 512.4 tokens/s, Running: 5 reqs, Waiting: 0 reqs, GPU KV cache usage: 13.5%, Prefix cache hit rate: 89.5%
(APIServer pid=7) INFO 08-06 21:17:14 [loggers.py:314] Engine 000: Avg prompt throughput: 4154.6 tokens/s, Avg generation throughput: 354.9 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 9.4%, Prefix cache hit rate: 90.3%
(APIServer pid=7) INFO 08-06 21:17:24 [loggers.py:314] Engine 000: Avg prompt throughput: 644.4 tokens/s, Avg generation throughput: 568.5 tokens/s, Running: 5 reqs, Waiting: 0 reqs, GPU KV cache usage: 6.5%, Prefix cache hit rate: 90.7%


 
[:so-saugrenu4:7]

neo world tu dis ça à cause de la finition RGB chique et choc ? :o
 
mais sinon ouais la machine prend 100€ régulièrement mais on est loin des 6k :
https://www.bosgamepc.com/products/ [...] ai-max-395
 
Là j'en ai pour environ 8500 balles en comptant large avec les autres équipements réseau de la maison, les cables et les 96GB de RAM pour le NAS toujours pas arrivés depuis deux mois maintenant [:gaellamonf:5]
the_fennec J'ai lu que les Strix halo sont a 6k maintenant, donc rien que ton étage du bas il y en a pour 24k!
 
Je vais faire une photo pour montrer mon merdier :jap:
neo world tu nous a montré que les BC ! tu as quoi d'autre ? :D
 
edit avec le smiley qui va bien  
 [:fl0odaj_progressiv:9]
the_fennec Je dirais pas que 2030k€ de matos ça fait roots...
Il manque une Sun, un switch Cisco et du BNC :o
neo world Merci :jap:
 
Clairement y'a côté Roots assumé avec ton installe mais ce qui compte c'est la qualité du token :D
the_fennec C'est propre :jap:
Quand je vois mon bordel :lol:
neo world Bon c'est pas fini encore mais j'avais promis du hardware porn et time is running out  [:petit larousse]   :o
 
https://rehost.diberie.com/Picture/Get/f/534363  
excusez le bordel pour les câbles  [:clooney41]  mais je dois refaire tous les passages dans moins d'un an donc OSEF ça tournera comme ça  [:hahanawak]  
 
Dans l'ordre descendant :
=> bandeau de brassage (travaux en cours donc encore beaucoup de prises RJ45 sont non branchées encore mais ça vient petit à petit :D) mais a terme tous les Keystones seront utilisés
=> Swtich Gbe "tout venant"  
=> Switch d'agrégation 10GB SFP+ c'est le coeur de réseau L2 avec du 2X10Gb/s qui tâche vers le firewall et les switchs
=> Freebox 1Gb/s  [:haha fail] en attendant de faire upgrader la connexion et switch 10Gb/s où arrive tout le homelab (oui j'y arrive :o)
=> Firewall 4 X 10Gb/s. Pareil avec du LACP qui tâche histoire que ça respire en particulier quand y'a des accès vers le NAS
 
- Bon on se fait chier y'a toujours pas d'IA, on se casse  [:canard rouge]  
- Non revenez j'y viens :o

 
=> Le NAS qui fait tout le stockage backup de la baraque, la distribution des medias via Jellyfin en plus de faire l'inférence pour la detection d'objets sur des flux vidéo via le 780m intégré et frigate
=> Le AMD AI Strix halo. Pour l'instant il clignote en se tournant les pouces (le temps que je mette en place un backup automatique de tout le système pour facilement tout peter et tester des trucs plus ou moins expérimentaux sans devoir aller à la baie tout réinstaller comme ça m'est arrivé 5 ou 6 fois. La dernière fois étant y'a deux heures  :lol:
=> Le cluster de workers / agents. Ils servent à tous les services auto hebergés (repots git, agents, supervision, Collaboration/communication avec les agents)
 
C'est long mais on va en venir à bout et faire des trucs productifs :D
 
Pour les curieux ça donne ça en vu réseau (manque plein de VM :D )  
https://rehost.diberie.com/Picture/Get/f/534366
Nr13

the_fennec a écrit :


 
Le 27B est très bon pour sa taille, le 35B aussi, mais DS4 a 10x plus de paramètres quand même. Après j'ai pas testé DS4 ... :o


 
Alors rien à voir avec DS4-Flash, deja avant la maj du 3107..

the_fennec inclusionAI/Ling-3.0-flash

Citation :

We're introducing Ling-3.0-flash, our next-generation native hybrid reasoning model. Operating with 124B total and 5.1B active parameters (~12.4% and ~8.1% of our previous 1T-class flagship Ring-2.6-1T), Ling-3.0-flash matches or outperforms its predecessor across key benchmarks.


 
https://huggingface.co/inclusionAI/Ling-3.0-flash
des ggufs:
https://huggingface.co/AtomicChat/Ling-3.0-flash-GGUF
 
Ajouté a ma liste de truc a tester :o
edit:

Citation :

The bailingmoe3 architecture is not in upstream llama.cpp, so these files need a TurboQuant build. Nothing has to be compiled: grab the archive for your machine from release b10269-1.5.0 or newer.


 
 
En bonus un DS4 REAP de 54GB:
https://huggingface.co/jabbatheduck [...] flash-mini

the_fennec

Citation :

Today we introduce Maple-Preview, an open-source 20B-A1B ternary-weight reasoning LLM. Maple-Preview has SOTA reasoning for its weight class and is even competitive with larger models. It solves IMO-level problems and runs at 200+ tokens/sec on a Mac mini M4, 5–16× faster than efficient models like Gemma 4, Qwen3.5, and gpt-oss.


 
https://i.imgur.com/jknjjq8.png  
 
https://deepgrove.ai/maple-preview
https://huggingface.co/deepgrove/maple-preview
 
Un modèle MoE qui tient dans 8GB de VRAM avec 131k de contexte et qui tient la route face a Qwen 35B et 27B ternary! A surveiller :)

the_fennec

Pipould's a écrit :


C'est pas tant des deadlines, c'est juste que attendre 2 semaines pour un résultat t'as déjà un nouveau modèle de sorti ou des optimisations...  


 
De mon coté c'est pour le fun, j'essaye de charger des "gros" modèle sur mon archi alacon (4060TI + 2x BC250) et ça marche. Je mets 27B MTP en Q8 avec 256k de contexte, mais j’accepte un pp/tg très bas. J'ai presque 48GB de VRAM pour moins de 600 euros, j'avais pris la 4060 dans les 300 euros il y a un moment et les deux BC250 pour 230 euros ya pas longtemps.
 
A coté j'ai Claude, Kiro, Cursor et Bedrock pour le taf' et Gemini avec mon drive 5TB en perso.

neo world problèmes de riche :o
 
https://ardalis.com/img/oh-my-sweet-summer-child.jpg
Pipould's

neo world a écrit :

tu as du mal parce que tu as des deadlines à tenir ou tu es pressé. Perso ça fait 5 mois que je rebuild mon homelab (trois grosses itérations avec des amélioration entre chaque)

 

C'est un plaisir que je n'aurais jamais pris si j'avais le début d'une deadline (d'ailleurs je m'en trouve tout seul histoire que ça ne tombe pas en désuétude)

 

Si tout va bien je ferais une photo hardware porn / software porn d'ici la semaine prochaine. Si j'y arrive pas je sais pas si ça sera prêt vraiment un jour avec le départ en vacances de l'assistante maternelle :o

 

C'est pas tant des deadlines, c'est juste que attendre 2 semaines pour un résultat t'as déjà un nouveau modèle de sorti ou des optimisations...

neo world tu as du mal parce que tu as des deadlines à tenir ou tu es pressé. Perso ça fait 5 mois que je rebuild mon homelab (trois grosses itérations avec des amélioration entre chaque)
 
C'est un plaisir que je n'aurais jamais pris si j'avais le début d'une deadline (d'ailleurs je m'en trouve tout seul histoire que ça ne tombe pas en désuétude)  
 
Si tout va bien je ferais une photo hardware porn / software porn d'ici la semaine prochaine. Si j'y arrive pas je sais pas si ça sera prêt vraiment un jour avec le départ en vacances de l'assistante maternelle :o

Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)