Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
3289 connectés 

 


Quel titre pour notre topic ?
Sondage à 8 choix possibles.
Ce sondage expirera le 15-08-2026 à 10:00




Attention si vous cliquez sur "voir les résultats" vous ne pourrez plus voter

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  27  28  29  30  31  32
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°43532
Plam
Bear Metal
Posté le 28-07-2026 à 16:24:13  profilanswer
 

Reprise du message précédent :

M300A a écrit :

Les 4 RTX 6k sont en cours de livraison, mais je vais avoir besoin de pièces en plus je pense.
 
Je commence par un DS4 Flash full ? Ca vaut le coup de tester autre chose comme un Qwen 3.5 400b compressé ? J'aurais aussi 512G de ddr5, ça vaudrait quand même le coup d'essayer un GML-5.2 ou c'est une perte de temps et je reporte ça si j'arrive à avoir 4 cartes de plus ?
 
:jap:


 
Ada ou Blackwell ? Parce que ça fait une belle diff de VRAM dispo.


---------------
Spécialiste du bear metal
n°43533
M300A
Posté le 28-07-2026 à 16:28:56  profilanswer
 

Blackwell server edition 96gb


---------------
:wq
n°43561
Plam
Bear Metal
Posté le 29-07-2026 à 07:23:04  profilanswer
 

ça commence à faire une belle puissance de feu. Prévu pour servir des utilisateurs en parallèle ou juste toi ?


---------------
Spécialiste du bear metal
n°43576
M300A
Posté le 29-07-2026 à 11:12:50  profilanswer
 

On peut monter à 4 ou 5 utilisateurs parallèles mais on ne sera que 2 utilisateurs sérieux et pas tout le temps. En vrai on devrait pas trop ce marcher dessus, si c'est le cas on s'accordera oralement pour ne pas défoncer la machine. :o


---------------
:wq
n°43578
neo world
Posté le 29-07-2026 à 12:03:20  profilanswer
 
n°43579
M300A
Posté le 29-07-2026 à 12:25:46  profilanswer
 

 

Je n'exclue pas que certains se sentent concernés et se mettent à bosser avec, mais ça reste avec une probabilité faible :o


---------------
:wq
n°43583
neo world
Posté le 29-07-2026 à 12:49:13  profilanswer
 

perso je ne leur dirais rien :o

n°43584
b-tzu
Geek a toute heure...
Posté le 29-07-2026 à 13:14:14  profilanswer
 

apres si vraiment cest la et ca fait de la peine, genre ca passe des heures a se tourner les pouces, on veut bien te donner un coup de main ! pour la science


---------------
Topic Ventes || Topic Jeux Vidéos || Topic Téléphonie (Rien pour le moment)
n°43585
M300A
Posté le 29-07-2026 à 13:22:00  profilanswer
 

Moi tout seul je peux faire tourner le truc 24/24, pas d'inquiétudes :o


---------------
:wq
n°43586
croustx
Modoadorateur
Posté le 29-07-2026 à 13:27:52  profilanswer
 

Tu l'utilise pour quoi ? :o

n°43587
neo world
Posté le 29-07-2026 à 13:31:39  profilanswer
 

b-tzu a écrit :

apres si vraiment cest la et ca fait de la peine, genre ca passe des heures a se tourner les pouces, on veut bien te donner un coup de main ! pour la science


c'est ça l'esprit de ce topic : aucun hardware ne sera abandonné :o
 
MAJ du titre du topic du coup :o


Message édité par neo world le 29-07-2026 à 13:32:52
n°43596
the_fennec
f3nn3cUs z3rd4
Posté le 29-07-2026 à 14:39:36  profilanswer
 

Bof bof le titre :/


---------------
Faudra que je teste un jour :o
n°43598
neo world
Posté le 29-07-2026 à 14:44:47  profilanswer
 

Propose :D

n°43599
the_fennec
f3nn3cUs z3rd4
Posté le 29-07-2026 à 15:07:45  profilanswer
 

IA locale: llama.cpp, VLLM, modèles, tuning! For science. You monster. :o


---------------
Faudra que je teste un jour :o
n°43600
LaRoueEstT​ombee
Hortense ! Pour moi !
Posté le 29-07-2026 à 15:16:16  profilanswer
 

C'est vraiment pas intelligent de modifier le titre d'un topic :o  
 
neo world demition [:bap2703:2]


---------------
Votre couroux impitoiable Veut-il renverser l'Univers ?
n°43601
the_fennec
f3nn3cUs z3rd4
Posté le 29-07-2026 à 15:23:11  profilanswer
 

J'aimais bien l'ancien, mais je m'en souviens plus :D
 [:toum_toum]  
Il faut pas changer les trucs sinon c'est différent de comme on a toujours fait avant :o


---------------
Faudra que je teste un jour :o
n°43602
neo world
Posté le 29-07-2026 à 15:37:26  profilanswer
 

j'ai fait un sondage :D
 
On fera ça en deux tours : vous votez et vous faites vos propales si vous en avez.
 
Au bout de deux semaines on garde les deux premiers des votes et on ajoute les propositions que vous aurez faites d'ici la fin du sondage :D


Message édité par neo world le 29-07-2026 à 15:50:53
n°43604
LaRoueEstT​ombee
Hortense ! Pour moi !
Posté le 29-07-2026 à 16:25:23  profilanswer
 

Le titre du topic est bien, le petit souci, c'est qu'il y a pas mal de blabla qui ne devrait pas être là mais dans les topics plus appropriés. Plus facile à dire qu'à faire, vu que le sujet est vaste...
 
Sinon, il manque l'option "Obiwan défonce le Puppet Master :o " dans ce sondage [:ooinverse]


---------------
Votre couroux impitoiable Veut-il renverser l'Univers ?
n°43605
lapin
Posté le 29-07-2026 à 16:47:26  profilanswer
 

Lapin à voté:
 
 
1.  Infra IA : aide au choix et troubleshot de LLM Locaux 5.6 % 1 vote
 
 5.6 %
 1 vote
6.  IA Locale : vous aussi venez mesurer votre pouvoir d'achat en HBM / GDDR / LPDDR / DDR / SDRam / EDO ...  16.7 % 3 votes
7.  IA Locale : aucun GPU ni LLM n'a été maltraité pour cette inférence
 
 
 
D'ailleurs la 7ième m'a bien fait marrer  :lol:  :whistle: !!!

n°43606
Jules Winn​field
порой не та...
Posté le 29-07-2026 à 17:07:23  profilanswer
 

J'ai voté 1 :o
Par contre, si je peux me permettre, vu que le topic est maintenant situé dans la catégorie IA, existe t'il encore un intérêt à mettre le IA dans le titre ?
Par exemple, pour le choix 1 : "Infra : aide au choix et troubleshot de LLM Locaux" plutôt que "Infra IA : aide au choix et troubleshot de LLM Locaux"

n°43607
neo world
Posté le 29-07-2026 à 17:10:16  profilanswer
 

Je le proposerai en deuxième phase de vote. Mais pour ceux qui suivent les topics sans voir les catégories (genre redface) et pour le bonheur du SEO ça vaut le coup de laisser IA je pense même si c’est bien redondant :)


Message édité par neo world le 29-07-2026 à 17:13:38
n°43608
Jules Winn​field
порой не та...
Posté le 29-07-2026 à 17:17:08  profilanswer
 

Justement, si je peux toujours me permettre, sur redface, les catégories sont visibles, par contre, l'ennemi c'est la longueur : si le nom du topic est très long, il ne s'affiche pas en entier

n°43613
yohaskan
Posté le 29-07-2026 à 18:03:30  profilanswer
 

Moi je tiens à "Local",  
En gros, Les solutions pour héberger son système localement.
 
Il y avait eu un post sur ce sujet sur...  LocalLLaMA
Why do we allow "un-local" content
https://www.reddit.com/r/LocalLLaMA [...] l_content/


Message édité par yohaskan le 29-07-2026 à 18:04:17
n°43644
Olivie
SUUUUUUUUUUUUUU
Posté le 29-07-2026 à 21:16:58  profilanswer
 

Citation :

@UnslothAI
Kimi K3 can now be run locally!  
 
The 1-bit model retains ~78.9% accuracy after we shrunk it from 1.56TB to 594GB (-62% size).
 
Run on a Mac Studio + 128GB RAM device.
 
Kimi K3 is the strongest open model to date.
 
Guide: https://unsloth.ai/docs/models/kimi-k3
GGUF: https://huggingface.co/unsloth/Kimi-K3-GGUF


---------------

n°43646
neo world
Posté le 29-07-2026 à 21:18:17  profilanswer
 

Olivie a écrit :

Citation :

@UnslothAI
Kimi K3 can now be run locally!  
 
The 1-bit model retains ~78.9% accuracy after we shrunk it from 1.56TB to 594GB (-62% size).
 
Run on a Mac Studio + 128GB RAM device.
 
Kimi K3 is the strongest open model to date.
 
Guide: https://unsloth.ai/docs/models/kimi-k3
GGUF: https://huggingface.co/unsloth/Kimi-K3-GGUF



Même Joce et M300A n'ont pas assez de (v)RAM  :pt1cable:

n°43648
Olivie
SUUUUUUUUUUUUUU
Posté le 29-07-2026 à 21:24:19  profilanswer
 

neo world a écrit :


Même Joce et M300A n'ont pas assez de (v)RAM  :pt1cable:


Ah. Moi qui croyais qu'ils en avaient une grosse :o
 

Citation :

@Eschalabs
Today we are introducing Escha-W2 quantization.
 
A 2-bit Qwen3.6-35B-A3B model built for fast, local inference. The complete model is 12.3GB on disk—small, enough to run on a single consumer GPU — while averaging ~100% of FP8 performance across 12 benchmarks, including:
 
MMLU-Pro: 80.9
MATH-500: 93.8
GPQA-Diamond: 77.8
LiveCodeBench v6: 62.6
BFCL tool use: 88.9
RULER 8K–128K: 89.9
Commonsense-6: 76.1
 
On a single RTX 4090, the model runs:
225 tok/s single-stream generation
on 12.3GB on-disk model size


https://huggingface.co/EschaLabs/Qw [...] B-Escha-W2
 
Y a pas de bouton pour le download vers Ollama / LM studio ?


---------------

n°43649
Plam
Bear Metal
Posté le 29-07-2026 à 21:36:17  profilanswer
 

Faut que je regarde l'usage chez nous des 2 GPUs maintenant qu'on l'a démocratisé. Je vous ferai un retour avec un blog post quand j'aurai le temps :jap:


---------------
Spécialiste du bear metal
n°43652
M300A
Posté le 29-07-2026 à 21:53:56  profilanswer
 

neo world a écrit :


Même Joce et M300A n'ont pas assez de (v)RAM  :pt1cable:

 

Un GML 5.2 en 4 bits ça me suffirait je pense, je demande pas plus.


---------------
:wq
n°43654
Plam
Bear Metal
Posté le 29-07-2026 à 22:18:36  profilanswer
 

M300A a écrit :


 
Un GML 5.2 en 4 bits ça me suffirait je pense, je demande pas plus.


 
C'est pourquoi ton usage local ? Côté code surtout sécu/cyber ou autre ? parce que ça fait beaucoup de vRAM certes mais aussi de puissance dispo.


---------------
Spécialiste du bear metal
n°43655
M300A
Posté le 29-07-2026 à 22:50:28  profilanswer
 

Agentic coding, d'autres pourraient s'en servir pour faire de la review de documents multilingues (peut être garder un peu de place pour mettre un truc dédié à ca genre un petit mistral ou gemma)


---------------
:wq
n°43658
the_fennec
f3nn3cUs z3rd4
Posté le 29-07-2026 à 23:06:21  profilanswer
 

Olivie a écrit :


Citation :

@Eschalabs
Today we are introducing Escha-W2 quantization.
 
A 2-bit Qwen3.6-35B-A3B model built for fast, local inference. The complete model is 12.3GB on disk—small, enough to run on a single consumer GPU — while averaging ~100% of FP8 performance across 12 benchmarks, including:
 
MMLU-Pro: 80.9
MATH-500: 93.8
GPQA-Diamond: 77.8
LiveCodeBench v6: 62.6
BFCL tool use: 88.9
RULER 8K–128K: 89.9
Commonsense-6: 76.1
 
On a single RTX 4090, the model runs:
225 tok/s single-stream generation
on 12.3GB on-disk model size


https://huggingface.co/EschaLabs/Qw [...] B-Escha-W2
 
Y a pas de bouton pour le download vers Ollama / LM studio ?


 
Il est pas compatible llama.cpp, ils ont leur propre moteur basé sur slang:

Citation :

This repo holds only the model. The runtimes live in a separate repo, EschaLabs/escha-runtime-qwen3moe, one directory per engine: sglang/ (the escha wheel + serve.sh — servers, concurrency, tools, structured output) and zml/ (a single-binary runtime — no Python, no dependencies, and the stronger single-user decode on most cards).


Message édité par the_fennec le 29-07-2026 à 23:06:46

---------------
Faudra que je teste un jour :o
n°43664
neo world
Posté le 30-07-2026 à 03:28:32  profilanswer
 

et maintenant gigatoken à la rescousse de votre pre-processing : https://medium.com/data-science-in- [...] 76969b793e  

n°43666
Olivie
SUUUUUUUUUUUUUU
Posté le 30-07-2026 à 06:31:13  profilanswer
 

M300A a écrit :

Agentic coding, d'autres pourraient s'en servir pour faire de la review de documents multilingues (peut être garder un peu de place pour mettre un truc dédié à ca genre un petit mistral ou gemma)


 :jap:


---------------

n°43719
neo world
Posté le 30-07-2026 à 20:06:10  profilanswer
 

Olivie a écrit :

Citation :

@UnslothAI
Kimi K3 can now be run locally!  
 
The 1-bit model retains ~78.9% accuracy after we shrunk it from 1.56TB to 594GB (-62% size).
 
Run on a Mac Studio + 128GB RAM device.
 
Kimi K3 is the strongest open model to date.
 
Guide: https://unsloth.ai/docs/models/kimi-k3
GGUF: https://huggingface.co/unsloth/Kimi-K3-GGUF



pour ceux qui cherchent une machine d'entrée de gamme pour faire tourner ce modèle  :
https://www.ctoservers.com/nvidia-d [...] 6130-p.asp
 
A noter que si le marché de l'occasion ne vous effraie pas vous pouvez trouver le Mac studio Ultra M3 512GB pour environ 60k€ la paire. Avec des économies d’énergie substantielles en prime si vous êtes ok à avoir un peu moins de tokens / seconde :jap:
 
 [:paul de saint-balby:4]  [:tapis_fan:3]  [:paul de saint-balby:5] :o


Message édité par neo world le 30-07-2026 à 20:06:56
n°43740
Plam
Bear Metal
Posté le 31-07-2026 à 07:43:04  profilanswer
 

M300A a écrit :

Agentic coding, d'autres pourraient s'en servir pour faire de la review de documents multilingues (peut être garder un peu de place pour mettre un truc dédié à ca genre un petit mistral ou gemma)


 
Avec j'imagine l'envie que ça reste tout chez vous/en local par rapport au prix d'un Claude max :D


---------------
Spécialiste du bear metal
n°43757
AllenMadis​on
Oracle du Keb's
Posté le 31-07-2026 à 11:56:56  profilanswer
 

Drapal, pour l'instant un petit ollama qui tourne en local sur une 3080 et 32go de ram


---------------
Nothing much to teach, man. There's ze high, there's ze low and yall still fucking miss.
n°43792
M300A
Posté le 31-07-2026 à 17:15:43  profilanswer
 

Plam a écrit :

 

Avec j'imagine l'envie que ça reste tout chez vous/en local par rapport au prix d'un Claude max :D

 

C'est l'idée oui, disons qu'officiellement on a pas tellement le choix mais en vrai la très large majorité de ce qu'on brasse n'a absolument aucun caractère confidentiel.
Mais au moins, ça sera propre.


---------------
:wq
n°43794
the_fennec
f3nn3cUs z3rd4
Posté le 31-07-2026 à 17:38:08  profilanswer
 

Je suis en train de tester little-coder:
https://github.com/itayinbarr/little-coder
 
J'avais vu le projet ya un moment, mais trop jeune. Je trouve que c'est pas mal du tout pour le moment.
 
J'y ai repensé en regardant cette vidéo qui est OK, mais parle un peu de features spéciales "model local":
https://www.youtube.com/watch?v=YH1EjnYFWSU
 
de mémoire:
* détection de boucles
* détection de tooling foireux
* force le modèle a faire des edits au lieu de lire et écrire les fichiers en entier
* gestion de contexte spéciale  


---------------
Faudra que je teste un jour :o
n°43806
Olivie
SUUUUUUUUUUUUUU
Posté le 31-07-2026 à 21:25:22  profilanswer
 

Qui a le matos pour tester ? :o
 

Citation :

@UnslothAI
 
DeepSeek V4 Flash 0731 can now be run locally!  
 
Run DeepSeek V4 Flash lossless 4-bit on 168GB RAM and 3-bit on 110GB RAM.
 
V4 Flash 0731 outperforms V4 Pro. Run via Unsloth or llama.cpp. Smaller quants coming today.
 
Guide: https://unsloth.ai/docs/models/deepseek-v4
GGUF: https://huggingface.co/unsloth/Deep [...] -0731-GGUF


---------------

n°43809
M300A
Posté le 31-07-2026 à 22:16:58  profilanswer
 

Ptetre lundi si les gars de bougent


---------------
:wq
n°43810
neo world
Posté le 31-07-2026 à 22:25:24  profilanswer
 

j'ai de quoi faire tourner la version 3bit mais je remonte mon infra seulement courant de semaine prochaine :jap:

 Page :   1  2  3  4  5  ..  27  28  29  30  31  32

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)