Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
5271 connectés 

 


Quel titre pour notre topic ?
Sondage à 8 choix possibles.
Ce sondage expirera le 15-08-2026 à 10:00




Attention si vous cliquez sur "voir les résultats" vous ne pourrez plus voter

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  27  28  29  30  31  32
Page Suivante
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°44118
neo world
Posté le 05-08-2026 à 00:11:35  profilanswer
 

Reprise du message précédent :
tu as du mal parce que tu as des deadlines à tenir ou tu es pressé. Perso ça fait 5 mois que je rebuild mon homelab (trois grosses itérations avec des amélioration entre chaque)
 
C'est un plaisir que je n'aurais jamais pris si j'avais le début d'une deadline (d'ailleurs je m'en trouve tout seul histoire que ça ne tombe pas en désuétude)  
 
Si tout va bien je ferais une photo hardware porn / software porn d'ici la semaine prochaine. Si j'y arrive pas je sais pas si ça sera prêt vraiment un jour avec le départ en vacances de l'assistante maternelle :o

n°44119
Pipould's
Posté le 05-08-2026 à 00:20:31  profilanswer
 

neo world a écrit :

tu as du mal parce que tu as des deadlines à tenir ou tu es pressé. Perso ça fait 5 mois que je rebuild mon homelab (trois grosses itérations avec des amélioration entre chaque)

 

C'est un plaisir que je n'aurais jamais pris si j'avais le début d'une deadline (d'ailleurs je m'en trouve tout seul histoire que ça ne tombe pas en désuétude)

 

Si tout va bien je ferais une photo hardware porn / software porn d'ici la semaine prochaine. Si j'y arrive pas je sais pas si ça sera prêt vraiment un jour avec le départ en vacances de l'assistante maternelle :o

 

C'est pas tant des deadlines, c'est juste que attendre 2 semaines pour un résultat t'as déjà un nouveau modèle de sorti ou des optimisations...

n°44120
neo world
Posté le 05-08-2026 à 00:30:56  profilanswer
 

problèmes de riche :o
 
https://ardalis.com/img/oh-my-sweet-summer-child.jpg

n°44126
the_fennec
f3nn3cUs z3rd4
Posté le 05-08-2026 à 08:24:46  profilanswer
 

Pipould's a écrit :


C'est pas tant des deadlines, c'est juste que attendre 2 semaines pour un résultat t'as déjà un nouveau modèle de sorti ou des optimisations...  


 
De mon coté c'est pour le fun, j'essaye de charger des "gros" modèle sur mon archi alacon (4060TI + 2x BC250) et ça marche. Je mets 27B MTP en Q8 avec 256k de contexte, mais j’accepte un pp/tg très bas. J'ai presque 48GB de VRAM pour moins de 600 euros, j'avais pris la 4060 dans les 300 euros il y a un moment et les deux BC250 pour 230 euros ya pas longtemps.
 
A coté j'ai Claude, Kiro, Cursor et Bedrock pour le taf' et Gemini avec mon drive 5TB en perso.


Message édité par the_fennec le 05-08-2026 à 08:25:59

---------------
Faudra que je teste un jour :o
n°44173
the_fennec
f3nn3cUs z3rd4
Posté le 05-08-2026 à 16:24:54  profilanswer
 

Citation :

Today we introduce Maple-Preview, an open-source 20B-A1B ternary-weight reasoning LLM. Maple-Preview has SOTA reasoning for its weight class and is even competitive with larger models. It solves IMO-level problems and runs at 200+ tokens/sec on a Mac mini M4, 5–16× faster than efficient models like Gemma 4, Qwen3.5, and gpt-oss.


 
https://i.imgur.com/jknjjq8.png
 
https://deepgrove.ai/maple-preview
https://huggingface.co/deepgrove/maple-preview
 
Un modèle MoE qui tient dans 8GB de VRAM avec 131k de contexte et qui tient la route face a Qwen 35B et 27B ternary! A surveiller :)


Message édité par the_fennec le 05-08-2026 à 16:26:28

---------------
Faudra que je teste un jour :o
n°44178
the_fennec
f3nn3cUs z3rd4
Posté le 05-08-2026 à 17:26:31  profilanswer
 

inclusionAI/Ling-3.0-flash

Citation :

We're introducing Ling-3.0-flash, our next-generation native hybrid reasoning model. Operating with 124B total and 5.1B active parameters (~12.4% and ~8.1% of our previous 1T-class flagship Ring-2.6-1T), Ling-3.0-flash matches or outperforms its predecessor across key benchmarks.


 
https://huggingface.co/inclusionAI/Ling-3.0-flash
des ggufs:
https://huggingface.co/AtomicChat/Ling-3.0-flash-GGUF
 
Ajouté a ma liste de truc a tester :o
edit:

Citation :

The bailingmoe3 architecture is not in upstream llama.cpp, so these files need a TurboQuant build. Nothing has to be compiled: grab the archive for your machine from release b10269-1.5.0 or newer.


 
 
En bonus un DS4 REAP de 54GB:
https://huggingface.co/jabbatheduck [...] flash-mini


Message édité par the_fennec le 05-08-2026 à 17:27:50

---------------
Faudra que je teste un jour :o
n°44182
Nr13
Posté le 05-08-2026 à 19:43:33  profilanswer
 

the_fennec a écrit :


 
Le 27B est très bon pour sa taille, le 35B aussi, mais DS4 a 10x plus de paramètres quand même. Après j'ai pas testé DS4 ... :o


 
Alors rien à voir avec DS4-Flash, deja avant la maj du 3107..

n°44262
neo world
Posté le 06-08-2026 à 17:26:20  profilanswer
 

Bon c'est pas fini encore mais j'avais promis du hardware porn et time is running out  [:petit larousse]   :o
 
https://rehost.diberie.com/Picture/Get/f/534363
excusez le bordel pour les câbles  [:clooney41]  mais je dois refaire tous les passages dans moins d'un an donc OSEF ça tournera comme ça  [:hahanawak]  
 
Dans l'ordre descendant :
=> bandeau de brassage (travaux en cours donc encore beaucoup de prises RJ45 sont non branchées encore mais ça vient petit à petit :D) mais a terme tous les Keystones seront utilisés
=> Swtich Gbe "tout venant"  
=> Switch d'agrégation 10GB SFP+ c'est le coeur de réseau L2 avec du 2X10Gb/s qui tâche vers le firewall et les switchs
=> Freebox 1Gb/s  [:haha fail] en attendant de faire upgrader la connexion et switch 10Gb/s où arrive tout le homelab (oui j'y arrive :o)
=> Firewall 4 X 10Gb/s. Pareil avec du LACP qui tâche histoire que ça respire en particulier quand y'a des accès vers le NAS
 
- Bon on se fait chier y'a toujours pas d'IA, on se casse  [:canard rouge]  
- Non revenez j'y viens :o

 
=> Le NAS qui fait tout le stockage backup de la baraque, la distribution des medias via Jellyfin en plus de faire l'inférence pour la detection d'objets sur des flux vidéo via le 780m intégré et frigate
=> Le AMD AI Strix halo. Pour l'instant il clignote en se tournant les pouces (le temps que je mette en place un backup automatique de tout le système pour facilement tout peter et tester des trucs plus ou moins expérimentaux sans devoir aller à la baie tout réinstaller comme ça m'est arrivé 5 ou 6 fois. La dernière fois étant y'a deux heures  :lol:
=> Le cluster de workers / agents. Ils servent à tous les services auto hebergés (repots git, agents, supervision, Collaboration/communication avec les agents)
 
C'est long mais on va en venir à bout et faire des trucs productifs :D
 
Pour les curieux ça donne ça en vu réseau (manque plein de VM :D )  
https://rehost.diberie.com/Picture/Get/f/534366


Message édité par neo world le 06-08-2026 à 17:28:47
n°44274
the_fennec
f3nn3cUs z3rd4
Posté le 06-08-2026 à 20:26:08  profilanswer
 

C'est propre :jap:
Quand je vois mon bordel :lol:


---------------
Faudra que je teste un jour :o
n°44276
neo world
Posté le 06-08-2026 à 20:48:45  profilanswer
 

Merci :jap:
 
Clairement y'a côté Roots assumé avec ton installe mais ce qui compte c'est la qualité du token :D

n°44277
the_fennec
f3nn3cUs z3rd4
Posté le 06-08-2026 à 20:55:06  profilanswer
 

Je dirais pas que 2030k€ de matos ça fait roots...
Il manque une Sun, un switch Cisco et du BNC :o


Message édité par the_fennec le 06-08-2026 à 20:55:35

---------------
Faudra que je teste un jour :o
n°44278
neo world
Posté le 06-08-2026 à 21:05:47  profilanswer
 

tu nous a montré que les BC ! tu as quoi d'autre ? :D
 
edit avec le smiley qui va bien  
 [:fl0odaj_progressiv:9]


Message édité par neo world le 06-08-2026 à 21:06:58
n°44279
the_fennec
f3nn3cUs z3rd4
Posté le 06-08-2026 à 21:13:19  profilanswer
 

J'ai lu que les Strix halo sont a 6k maintenant, donc rien que ton étage du bas il y en a pour 24k!
 
Je vais faire une photo pour montrer mon merdier :jap:


---------------
Faudra que je teste un jour :o
n°44280
neo world
Posté le 06-08-2026 à 21:19:42  profilanswer
 

tu dis ça à cause de la finition RGB chique et choc ? :o
 
mais sinon ouais la machine prend 100€ régulièrement mais on est loin des 6k :
https://www.bosgamepc.com/products/ [...] ai-max-395
 
Là j'en ai pour environ 8500 balles en comptant large avec les autres équipements réseau de la maison, les cables et les 96GB de RAM pour le NAS toujours pas arrivés depuis deux mois maintenant [:gaellamonf:5]

n°44281
M300A
Posté le 06-08-2026 à 23:17:42  profilanswer
 

Citation :


(APIServer pid=7) INFO 08-06 21:13:34 [loggers.py:314] Engine 000: Avg prompt throughput: 3616.3 tokens/s, Avg generation throughput: 230.2 tokens/s, Running: 3 reqs, Waiting: 0 reqs, GPU KV cache usage: 13.5%, Prefix cache hit rate: 85.8%
(APIServer pid=7) INFO 08-06 21:13:44 [loggers.py:314] Engine 000: Avg prompt throughput: 6401.0 tokens/s, Avg generation throughput: 269.2 tokens/s, Running: 4 reqs, Waiting: 0 reqs, GPU KV cache usage: 8.4%, Prefix cache hit rate: 81.0%
(APIServer pid=7) INFO 08-06 21:13:54 [loggers.py:314] Engine 000: Avg prompt throughput: 6874.1 tokens/s, Avg generation throughput: 344.6 tokens/s, Running: 5 reqs, Waiting: 0 reqs, GPU KV cache usage: 2.0%, Prefix cache hit rate: 80.3%
(APIServer pid=7) INFO 08-06 21:14:04 [loggers.py:314] Engine 000: Avg prompt throughput: 1806.3 tokens/s, Avg generation throughput: 635.8 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 2.0%, Prefix cache hit rate: 79.6%
(APIServer pid=7) INFO 08-06 21:14:14 [loggers.py:314] Engine 000: Avg prompt throughput: 2983.9 tokens/s, Avg generation throughput: 590.4 tokens/s, Running: 5 reqs, Waiting: 0 reqs, GPU KV cache usage: 9.1%, Prefix cache hit rate: 78.6%
(APIServer pid=7) INFO 08-06 21:14:24 [loggers.py:314] Engine 000: Avg prompt throughput: 6983.7 tokens/s, Avg generation throughput: 409.5 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 2.8%, Prefix cache hit rate: 77.6%
(APIServer pid=7) INFO 08-06 21:14:34 [loggers.py:314] Engine 000: Avg prompt throughput: 2550.8 tokens/s, Avg generation throughput: 609.9 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 14.8%, Prefix cache hit rate: 77.7%
(APIServer pid=7) INFO 08-06 21:14:44 [loggers.py:314] Engine 000: Avg prompt throughput: 6635.8 tokens/s, Avg generation throughput: 387.1 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 3.6%, Prefix cache hit rate: 77.7%
(APIServer pid=7) INFO 08-06 21:14:54 [loggers.py:314] Engine 000: Avg prompt throughput: 3148.5 tokens/s, Avg generation throughput: 547.7 tokens/s, Running: 5 reqs, Waiting: 0 reqs, GPU KV cache usage: 8.9%, Prefix cache hit rate: 78.6%
(APIServer pid=7) INFO 08-06 21:15:04 [loggers.py:314] Engine 000: Avg prompt throughput: 6454.2 tokens/s, Avg generation throughput: 341.4 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 4.4%, Prefix cache hit rate: 79.7%
(APIServer pid=7) INFO 08-06 21:15:14 [loggers.py:314] Engine 000: Avg prompt throughput: 4481.4 tokens/s, Avg generation throughput: 436.5 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 4.7%, Prefix cache hit rate: 81.0%
(APIServer pid=7) INFO 08-06 21:15:24 [loggers.py:314] Engine 000: Avg prompt throughput: 6621.5 tokens/s, Avg generation throughput: 313.8 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 12.3%, Prefix cache hit rate: 81.7%
(APIServer pid=7) INFO 08-06 21:15:34 [loggers.py:314] Engine 000: Avg prompt throughput: 3559.2 tokens/s, Avg generation throughput: 500.9 tokens/s, Running: 5 reqs, Waiting: 0 reqs, GPU KV cache usage: 4.3%, Prefix cache hit rate: 82.4%
(APIServer pid=7) INFO 08-06 21:15:44 [loggers.py:314] Engine 000: Avg prompt throughput: 3410.1 tokens/s, Avg generation throughput: 475.3 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 5.9%, Prefix cache hit rate: 83.1%
(APIServer pid=7) INFO 08-06 21:15:54 [loggers.py:314] Engine 000: Avg prompt throughput: 3726.1 tokens/s, Avg generation throughput: 390.2 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 13.9%, Prefix cache hit rate: 84.6%
(APIServer pid=7) INFO 08-06 21:16:04 [loggers.py:314] Engine 000: Avg prompt throughput: 3019.7 tokens/s, Avg generation throughput: 469.9 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 6.4%, Prefix cache hit rate: 85.5%
(APIServer pid=7) INFO 08-06 21:16:14 [loggers.py:314] Engine 000: Avg prompt throughput: 2217.1 tokens/s, Avg generation throughput: 516.1 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 11.6%, Prefix cache hit rate: 86.3%
(APIServer pid=7) INFO 08-06 21:16:24 [loggers.py:314] Engine 000: Avg prompt throughput: 3700.4 tokens/s, Avg generation throughput: 463.2 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 6.9%, Prefix cache hit rate: 86.8%
(APIServer pid=7) INFO 08-06 21:16:34 [loggers.py:314] Engine 000: Avg prompt throughput: 3148.0 tokens/s, Avg generation throughput: 420.8 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 11.6%, Prefix cache hit rate: 88.4%
(APIServer pid=7) INFO 08-06 21:16:44 [loggers.py:314] Engine 000: Avg prompt throughput: 2458.1 tokens/s, Avg generation throughput: 520.8 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 7.4%, Prefix cache hit rate: 88.8%
(APIServer pid=7) INFO 08-06 21:16:54 [loggers.py:314] Engine 000: Avg prompt throughput: 1182.8 tokens/s, Avg generation throughput: 555.1 tokens/s, Running: 5 reqs, Waiting: 0 reqs, GPU KV cache usage: 6.4%, Prefix cache hit rate: 89.3%
(APIServer pid=7) INFO 08-06 21:17:04 [loggers.py:314] Engine 000: Avg prompt throughput: 2243.0 tokens/s, Avg generation throughput: 512.4 tokens/s, Running: 5 reqs, Waiting: 0 reqs, GPU KV cache usage: 13.5%, Prefix cache hit rate: 89.5%
(APIServer pid=7) INFO 08-06 21:17:14 [loggers.py:314] Engine 000: Avg prompt throughput: 4154.6 tokens/s, Avg generation throughput: 354.9 tokens/s, Running: 6 reqs, Waiting: 0 reqs, GPU KV cache usage: 9.4%, Prefix cache hit rate: 90.3%
(APIServer pid=7) INFO 08-06 21:17:24 [loggers.py:314] Engine 000: Avg prompt throughput: 644.4 tokens/s, Avg generation throughput: 568.5 tokens/s, Running: 5 reqs, Waiting: 0 reqs, GPU KV cache usage: 6.5%, Prefix cache hit rate: 90.7%


 
[:so-saugrenu4:7]


---------------
:wq
 Page :   1  2  3  4  5  ..  27  28  29  30  31  32
Page Suivante

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)