Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
4121 connectés 

 


Quel titre pour notre topic ?
Sondage à 8 choix possibles.
Ce sondage expirera le 15-08-2026 à 10:00




Attention si vous cliquez sur "voir les résultats" vous ne pourrez plus voter

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  30  31  32  33  34  35
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°44676
johto84
Posté le 10-08-2026 à 18:50:25  profilanswer
 

Reprise du message précédent :

the_fennec a écrit :


 
C'est quoi ta CM? quelle gen le x4?
 
Teste tu verras bien. Si tu veux optimiser to mets un 35B avec les attentions layers sur la 70Ti.


 
 
Enfaite j'ai commander une 5060 ti 16go mais la j'ai une CM de merde avec un x1 en deuxieme slot LOOL, mais du coup je cherche une nouvelle CM par contre le problème c'est que en DDR4 sa n'existe pas du 8x 8x et j'ai 48go de ram atm sa me ferait mal au cul de devoir passer sur de la DDR5 juste pour avoir le 8x 8x sa fait un gros budget quand meme.  
 
Atm je cherche une Aorus elite en ddr4 z690 ou z790 pour avoir le x4 et précisément ce model pour faire rentré ma 70ti 3 slot sur le 5.0

n°44678
the_fennec
f3nn3cUs z3rd4
Posté le 10-08-2026 à 18:53:35  profilanswer
 

the_fennec a écrit :

Colibrì vs llama.cpp: Running DeepSeek V4 284B on CPU
https://www.youtube.com/watch?v=pIN-2oVJpyU
 
Codacus teste Colibrì :love:
Il explique bien ce gars et en plus il trouve des flags utiles dans llama.cpp: -nr (No Repack) je pense que c'est pour ça que j'arrive pas a charger DS4!
 
edit: pas mieux pour -nr :(


 
 :love: mon bug:
https://github.com/ggml-org/llama.cpp/issues/26820
 
Velu le bug, c'est que si on a plus d'un server RPC :lol:


Message édité par the_fennec le 10-08-2026 à 19:04:31

---------------
Faudra que je teste un jour :o
n°44679
Pipould's
Posté le 10-08-2026 à 18:54:59  profilanswer
 

johto84 a écrit :


 
Ouais c'est ce que je me disait, en 50/50 a 32go en tensor sa doit être strictement la meme que le double 60ti (qui est pas mauvais du tous xd y'a enormement de bench dessus c'est pas mal surtout avec le nvfp4)  
 
Tu est sur une asus créator sur ton double gpu c'est ça ? c'est du 8x 8x dessus ?  
 
Si le 4x me bride pas plus que sa et que sa fait genre 2 5060 ti a 32go sa me va


 
Ouais, sauf que comme un con la cm support 8x en gen 5 et  du coup avec les 3090 c'est bride a 8x en gen 4 :o
 
Bref...  
 
Je peux passer sur des RTX6000...  :( J'ai vraiment rate le coche de l'IA locale je peux dire.

n°44680
Pipould's
Posté le 10-08-2026 à 18:59:32  profilanswer
 

Sur le topic des gens PCIE... Est-ce que certains d'entre vous ont des CM en PCIE3 ?  Ca donne quoi ?

n°44682
the_fennec
f3nn3cUs z3rd4
Posté le 10-08-2026 à 19:01:58  profilanswer
 

johto84 a écrit :

Enfaite j'ai commander une 5060 ti 16go mais la j'ai une CM de merde avec un x1 en deuxieme slot LOOL, mais du coup je cherche une nouvelle CM par contre le problème c'est que en DDR4 sa n'existe pas du 8x 8x et j'ai 48go de ram atm sa me ferait mal au cul de devoir passer sur de la DDR5 juste pour avoir le 8x 8x sa fait un gros budget quand meme.  
 
Atm je cherche une Aorus elite en ddr4 z690 ou z790 pour avoir le x4 et précisément ce model pour faire rentré ma 70ti 3 slot sur le 5.0


 
Ha oui c'est con de passer en DDR 5 pour ça :(
Sinon chez AMD peut être?


---------------
Faudra que je teste un jour :o
n°44683
the_fennec
f3nn3cUs z3rd4
Posté le 10-08-2026 à 19:03:33  profilanswer
 

Pipould's a écrit :

Sur le topic des gens PCIE... Est-ce que certains d'entre vous ont des CM en PCIE3 ?  Ca donne quoi ?


Mon server a une MSI B450 GAMING PLUS MAX en pcie3, mais bon c'est pas ça qui me limite :o


---------------
Faudra que je teste un jour :o
n°44684
neo world
Posté le 10-08-2026 à 19:03:44  profilanswer
 

Pipould's a écrit :

Voici la photo de famille de mon barbecue / server d'inference:
 
https://i.ibb.co/gbqRFqyc/IMG-20260810-182729.jpg


Propre ! bravo ! Tu en tires un peu plus de tokens / seconde voir un peu d'overclocking ou c'est juste pour le silence de fonctionnement / la tranquillité d'esprit ? :D

n°44685
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 10-08-2026 à 19:03:55  profilanswer
 

Pipould's a écrit :


 
Ouais, sauf que comme un con la cm support 8x en gen 5 et  du coup avec les 3090 c'est bride a 8x en gen 4 :o
 
Bref...  
 
Je peux passer sur des RTX6000...  :( J'ai vraiment rate le coche de l'IA locale je peux dire.


 
Et un link connect entre les deux 3090 ?


---------------
Victime de girafophobie, mais se soigne.
n°44686
johto84
Posté le 10-08-2026 à 19:04:38  profilanswer
 

Pipould's a écrit :

 

Ouais, sauf que comme un con la cm support 8x en gen 5 et  du coup avec les 3090 c'est bride a 8x en gen 4 :o

 

Bref...

 

Je peux passer sur des RTX6000...  :( J'ai vraiment rate le coche de l'IA locale je peux dire.

 


Ouais mais ta regarder y'a combien de débit qui passe dessus en charge ? j'ai vu des trucs comme quoi y'a meme pas 4go/s max qui circulerai donc peut-être que meme un gen 4 seulment x4 ne le bride pas

 

Je sais pas y'a quoi comme tools pour check mais c'est sur que sa doit être possible.

 

ahhh le blackwell c'est devenu une folie avec le nvfp4 tbh c'est pour ça que je me dirige dessus.

 

On passe quasiment du simple au double en token/s c'est plutôt dingzz


Message édité par johto84 le 10-08-2026 à 19:06:03
n°44687
johto84
Posté le 10-08-2026 à 19:05:29  profilanswer
 

the_fennec a écrit :


 
Ha oui c'est con de passer en DDR 5 pour ça :(
Sinon chez AMD peut être?


 
Encore pire sa me ferait changer mon 13700kf

n°44688
Pipould's
Posté le 10-08-2026 à 19:07:53  profilanswer
 

neo world a écrit :


Propre ! bravo ! Tu en tires un peu plus de tokens / seconde voir un peu d'overclocking ou c'est juste pour le silence de fonctionnement / la tranquillité d'esprit ? :D


 
Sur le strix ? Uniquement le sustain et le silence. J'ai un PPT limite a 100w dessus.
 
En terme d'efficience le dual 3090 est au dessus... sic.

n°44691
neo world
Posté le 10-08-2026 à 19:52:54  profilanswer
 

Pipould's a écrit :


 
Sur le strix ? Uniquement le sustain et le silence. J'ai un PPT limite a 100w dessus.
 
En terme d'efficience le dual 3090 est au dessus... sic.


la GDDR vs lpddr ... :pt1cable:

n°44717
neo world
Posté le 11-08-2026 à 00:52:14  profilanswer
 

Pour ceux qui s'étonneraient de trouver des cartes Nvidia  [:mesh:3] avec 32GB de GDDR5  [:dworkin:3] pour moins de 150 balles [:wark0] avec des centaines de pièces en stock en Europe  [:paul de saint-balby]  : le M10 32GB n'a pas de tensor cores  [:haha pfff] et les 32GB sont en fait 8GB par GPU (soit 4 par carte) [:haha pfff].  
https://www.nvidia.com/content/dam/ [...] nl-Web.pdf
 
voilà voilà :o

n°44721
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 11-08-2026 à 01:18:40  profilanswer
 

Je m’étais servis de ce petit comparatif de gpu en inférence si ca peut aider https://www.reddit.com/r/LocalLLaMA [...] utm_term=1


---------------
Victime de girafophobie, mais se soigne.
n°44741
the_fennec
f3nn3cUs z3rd4
Posté le 11-08-2026 à 07:50:43  profilanswer
 

Muse Glimmer 30B GGUF de Meta 19GB + 1.5G draft
Le flappy bird:
https://volcanic-bedok-2drc.pagedrop.io
 
Base

Code :
  1. llama-server --load-mode dio --flash-attn on --metrics --alias default --host 0.0.0.0 --port 8080 --jinja --kv-unified -ctk q8_0 -ctv q8_0 -lv 4 -m muse-glimmer-30B-kquant-dynamic.gguf --rpc lain:50000,arisu:50000 -ngl 99 -ts 17,17,17 -ub 512 --ctx-size 131072 --temp 1.0 --top-p 0.95 --top-k 64 --reasoning-preserve


 
moyenne: 12.5 tg/s
 
DFlash draft=15

Code :
  1. llama-server --load-mode dio --flash-attn on --metrics --alias default --host 0.0.0.0 --port 8080 --jinja --kv-unified -ctk q8_0 -ctv q8_0 -lv 4 -m muse-glimmer-30B-kquant-dynamic.gguf --rpc lain:50000,arisu:50000 -ngl 99 -ts 17,17,17 -ub 512 --ctx-size 131072 --temp 1.0 --top-p 0.95 --top-k 64 --reasoning-preserve --spec-type draft-dflash --spec-draft-ngl 999 --spec-draft-n-max 15 --spec-draft-model muse-glimmer-30B-dflash-kquant.gguf


 
reasoning: 7 tg/s
code: 7/25 tg/s
 
moyenne: 10 tg/s
 
DFlash draft=3
 
reasoning: 10/15 tg/s
code: 11/23 tg/s
 
moyenne: 16 tg/s


Message édité par the_fennec le 11-08-2026 à 08:02:06

---------------
Faudra que je teste un jour :o
n°44742
the_fennec
f3nn3cUs z3rd4
Posté le 11-08-2026 à 08:14:11  profilanswer
 

Muse 30B GGUF Unsloth Q8 XL 32GB
https://crisp-ray-01f3.pagedrop.io
 
12 tg/s


---------------
Faudra que je teste un jour :o
n°44744
neo world
Posté le 11-08-2026 à 08:38:02  profilanswer
 

c'est le meilleurs flappybird que tu nous a partagé so far :D

n°44748
the_fennec
f3nn3cUs z3rd4
Posté le 11-08-2026 à 09:35:18  profilanswer
 

Non, je trouve que les Qwens sont bien meilleurs et de loin.


---------------
Faudra que je teste un jour :o
n°44749
neo world
Posté le 11-08-2026 à 09:46:00  profilanswer
 

On parle de ceux totalement injouables ? :o

n°44757
the_fennec
f3nn3cUs z3rd4
Posté le 11-08-2026 à 10:47:16  profilanswer
 

C'était Qwen Coder Next, un vieux tromblon :D
 
Qwen 3.6 çay bon :o (et 3.8 encore mieux ?)
 
Un truc marrant que j'ai vu dans le thinking de Muse (de mémoire): "let's make sure copyrights are respected" :lol:


---------------
Faudra que je teste un jour :o
n°44758
Pipould's
Posté le 11-08-2026 à 10:51:34  profilanswer
 

Bon, qwen 122b a10 en rocmfp4 a l'air utilisable avec le strix en "prod" on va dire...

n°44767
the_fennec
f3nn3cUs z3rd4
Posté le 11-08-2026 à 11:27:09  profilanswer
 

J'ai souvent lu que Qwen 3.6 27B était au dessus.


---------------
Faudra que je teste un jour :o
n°44774
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 11-08-2026 à 11:44:00  profilanswer
 

Muse sur la 3060+5070ti via unsloth ( l'application est super bien foutue ! )
26tok/s sans chercher d'optimisation.

 

La consommation de vram pour le cache eat ridicule.

 

En agent Hermes c'est pas ça encore.

 

Par contre la robustesse des appels outils est surprenante, en cas d'échec il trouve tout seul des alternatives en réessayant plusieurs fois sans perdre l'objectif.

 

Il fait beaucoup de franglais sur de l'analyse de documentation a source multiple en terme de langage.

 

J'ai eu pas mal d'hallucinations en full local, mais avec accès web il se corrige tout seul.

 


C'est vraiment une bonne surprise, je vais le monter en prod ce soir et on verra le bilan dans une semaine.


---------------
Victime de girafophobie, mais se soigne.
n°44776
the_fennec
f3nn3cUs z3rd4
Posté le 11-08-2026 à 11:52:05  profilanswer
 

Quel quant?


---------------
Faudra que je teste un jour :o
n°44780
proutmimol​ette
Posté le 11-08-2026 à 12:12:37  profilanswer
 

Salut, question peut être idiote mais comme je compte acheter ce pc, je me demandais s’il est capable de faire tourner des modèles récents ou si c’est du rêve: https://www.materiel.net/produit/202511190032.html
 
Merci!

n°44781
neo world
Posté le 11-08-2026 à 12:15:41  profilanswer
 

si l'IA est ton usage principal c'est pas la bonne machine :
https://www.asus.com/fr/laptops/for [...] 13-hn7306/
 
si l'IA est secondaire c'est une belle machine même si la 5090 à 24GB va rapidement te frustrer en IA :D

n°44790
johto84
Posté le 11-08-2026 à 13:57:58  profilanswer
 

proutmimolette a écrit :

Salut, question peut être idiote mais comme je compte acheter ce pc, je me demandais s’il est capable de faire tourner des modèles récents ou si c’est du rêve: https://www.materiel.net/produit/202511190032.html
 
Merci!


 
Pour 6k c'est criminel imo, ta vraiment besoin d'un portable ?  
 
avec 24go normalement tu passe tous les 27b trql par contre t'aura pas énormément de place pour le context

n°44794
proutmimol​ette
Posté le 11-08-2026 à 14:57:16  profilanswer
 

Bah en fait j’en ai marre d’attendre pour renouveler mon laptop et je me demandais simplement si j’allais pouvoir faire joujou, mais ce sera pas du tout l’usage principal. Merci pour votre retour en tout cas!

n°44795
the_fennec
f3nn3cUs z3rd4
Posté le 11-08-2026 à 15:04:33  profilanswer
 

proutmimolette a écrit :

Salut, question peut être idiote mais comme je compte acheter ce pc, je me demandais s’il est capable de faire tourner des modèles récents ou si c’est du rêve: https://www.materiel.net/produit/202511190032.html
 
Merci!


 
C'est dommage d'avoir que 24GB de VRAM et 64GB de RAM pour ce prix, mais bon c'est la mauvaise période.  
Après, oui tu peux faire tourner des modèles genre Qwen 27B/35B dessus, mais il risque de vite prendre feu :o


---------------
Faudra que je teste un jour :o
n°44804
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 11-08-2026 à 16:55:45  profilanswer
 


 
Q4_K_XL
 
https://huggingface.co/unsloth/Muse [...] _K_XL.gguf
 
Je l'ai testé avec plusieurs harness, sans surpris pi et little coder s'en sortent très bien avec  :whistle:  
 
Je l'ai mis dans des workflow assez directif et lui sur des tâches spécifique + un peu d'orchestration et il s'en sort mieux que qwen 3.6 en 27B. Par contre sur tout le reste je préfère largement qwen.


---------------
Victime de girafophobie, mais se soigne.
n°44806
the_fennec
f3nn3cUs z3rd4
Posté le 11-08-2026 à 17:23:59  profilanswer
 

Luke's Dev Lab
 
1-bit Bonsai 27B tested - 16GB Local LLM setup
https://www.youtube.com/watch?v=iHRFS4MVmNU
 
TLDR: don't bother :o
Je trouve que c'est quand même pas mal pour un quant de moins de 4GB!
 
 
Meta Muse Glimmer 30B tested - 16GB Local LLM setup Q4K XL
https://www.youtube.com/watch?v=zBfj19rM85w
 
TLDR: pretty impressed
Il se débrouille très bien avec le tool calling et MCP :love:


---------------
Faudra que je teste un jour :o
n°44807
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 11-08-2026 à 17:26:13  profilanswer
 

Oui vraiment les tools c'est son point fort !  


---------------
Victime de girafophobie, mais se soigne.
n°44811
Olivie
SUUUUUUUUUUUUUU
Posté le 11-08-2026 à 18:12:11  profilanswer
 

Citation :

@UnslothAI
Introducing Unsloth Desktop  
The first desktop app to run and train models locally.
 
• Open-source. Runs on Mac, Windows and Linux
• Supports MLX, diffusion image/video, audio, GGUF
• Connect Claude Code and Codex to local LLMs
• 50% more accurate, self-healing tool calls + sandboxed code exec
• Works for CPU + multiGPU setups - NVIDIA, AMD, Intel, Mac
• Train models 2× faster with 70% less VRAM
• Private web search, deep research, RAG, MCP and exports (NVFP4, GGUF)
• Use Unsloth’s OpenAI-compatible API and cloud models
• Securely deploy LLMs remotely and access anywhere
 
Unsloth Desktop is now available on http://unsloth.ai and GitHub.
 
GitHub: https://github.com/unslothai/unsloth
Blog and Guide: https://unsloth.ai/docs/desktop


---------------

n°44815
the_fennec
f3nn3cUs z3rd4
Posté le 11-08-2026 à 18:31:10  profilanswer
 

neo world a écrit :

c'est le meilleurs flappybird que tu nous a partagé so far :D


 
Qwen3.6-27B

Spoiler :

UD-Q8_K_XL_MTP :o


 
https://nebular-tree-329n.pagedrop.io
 
11 tg/s et 11min de génération.
 
Il me semble que 35B était pas loin en qualité.


---------------
Faudra que je teste un jour :o
n°44824
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 11-08-2026 à 21:54:43  profilanswer
 

Je continue avec l'usage de Muse dans mes workflow habituels, et grosse surprise il enterre complètement qwen 3.6 27b et gemma sur la vision.
J'avais pas mal de raté sur des détections d'objets sur des fonds chargés, je dois pas être loins des 100% de réussite avec Muse c'est impressionnant.


---------------
Victime de girafophobie, mais se soigne.
n°44827
moyen_moin​s
chat réincarné
Posté le 12-08-2026 à 02:27:51  profilanswer
 

Pipould's a écrit :

Bon, qwen 122b a10 en rocmfp4 a l'air utilisable avec le strix en "prod" on va dire...


ah ?
tu peux en dire plus ? :)

n°44828
moyen_moin​s
chat réincarné
Posté le 12-08-2026 à 02:38:56  profilanswer
 

Tronklou a écrit :

Je continue avec l'usage de Muse dans mes workflow habituels, et grosse surprise il enterre complètement qwen 3.6 27b et gemma sur la vision.
J'avais pas mal de raté sur des détections d'objets sur des fonds chargés, je dois pas être loins des 100% de réussite avec Muse c'est impressionnant.


j'avais en projet de faire un 'outil' pour faire de l'extraction automatique de critères intrinsèques dans des datasheets de composants électronique pour faire du calcul de fiab presse bouton (et construire les bdd à la main, c'est relou).
Dans le plan proposé par je sais plus quel modèle, il faisait appel à un modèle avec vision intégré et j'étais parti sur du qwen 3.6 35b mais si tu dis que Muse est mieux, va falloir que je teste [:transparency]

n°44834
Olivie
SUUUUUUUUUUUUUU
Posté le 12-08-2026 à 07:53:04  profilanswer
 

Citation :

@trycua
 
1/ Today, as part of our broader research into Apple Silicon virtualization, we're releasing a process-scoped Metal capability layer for macOS VMs. On one M1 Ultra, prompt / generation:
 
TinyLlama: 11.08× / 16.36×
Gemma 4 12B: 7.20× / 14.54×
Muse Glimmer 30B: 7.55× / 8.87×


---------------

n°44835
the_fennec
f3nn3cUs z3rd4
Posté le 12-08-2026 à 08:06:57  profilanswer
 

Test de CMP170HX x4 :love:  
https://www.reddit.com/r/LocalLLaMA [...] _cmp170hx/


---------------
Faudra que je teste un jour :o
n°44882
croustx
Modoadorateur
Posté le 12-08-2026 à 13:43:08  profilanswer
 

On me propose un lot d'une 10aine de cmp 30hx  
 
C'est jouable vous pensez ?

n°44883
neo world
Posté le 12-08-2026 à 13:46:08  profilanswer
 

6GB et pas de tensor core (donc ça va consommer beaucoup en prime). Tu voulais en faire quoi ? ^^

 Page :   1  2  3  4  5  ..  30  31  32  33  34  35

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)