Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
8055 connectés 

 


Dernière réponse
Sujet : Infra IA : aide au choix et troubleshot de LLM Locaux
the_fennec

neo world a écrit :

AMD propose de desserrer le frein à main sur ses  igpu avec le kernel linux 7.4 :
https://www.phoronix.com/review/amd-perfopt
 

Citation :

AMD's new PerfOpt feature being introduced in Linux 7.4 is set to provide some solid gains as shown in these benchmarks today across different AMD Ryzen/Radeon hardware.


 
en version 8.X on pourra peut peut être aussi détacher l'enclume et le fer à repasser  [:perco_35:2] :o


 
Tous les gains sont bons a prendre :jap:
Facilement 2 TG/s sur Strix et 4/5 sur un laptop en carton :love:


Votre réponse
Nom d'utilisateur    Pour poster, vous devez être inscrit sur ce forum .... si ce n'est pas le cas, cliquez ici !
Le ton de votre message                        
                       
Votre réponse


[b][i][u][strike][spoiler][fixed][cpp][url][email][img][*]   
 
   [quote]
 

Options

 
Vous avez perdu votre mot de passe ?


Vue Rapide de la discussion
the_fennec

neo world a écrit :

AMD propose de desserrer le frein à main sur ses  igpu avec le kernel linux 7.4 :
https://www.phoronix.com/review/amd-perfopt
 

Citation :

AMD's new PerfOpt feature being introduced in Linux 7.4 is set to provide some solid gains as shown in these benchmarks today across different AMD Ryzen/Radeon hardware.


 
en version 8.X on pourra peut peut être aussi détacher l'enclume et le fer à repasser  [:perco_35:2] :o


 
Tous les gains sont bons a prendre :jap:
Facilement 2 TG/s sur Strix et 4/5 sur un laptop en carton :love:

neo world AMD propose de desserrer le frein à main sur ses  igpu avec le kernel linux 7.4 :
https://www.phoronix.com/review/amd-perfopt
 

Citation :

AMD's new PerfOpt feature being introduced in Linux 7.4 is set to provide some solid gains as shown in these benchmarks today across different AMD Ryzen/Radeon hardware.


 
en version 8.X on pourra peut peut être aussi détacher l'enclume et le fer à repasser  [:perco_35:2] :o

neo world pour les accros d'halogen :  
https://github.com/gufo-org/gufo  
 
ne migrez pas tout de suite : c'est open source et les perfs sont encore meilleures mais le kv cache semble pas tout à fait au point encore :
https://github.com/gufo-org/gufo/issues
 
https://i.redd.it/9lw4fgl6a6sh1.png  
 

speedboyz30

Dezerd a écrit :


Et ouais.. Dans les fait c'est 10k€ max. [:julm3]  
C'est pour ça que je le considère plus comme une POC qu'autre chose..  


 
pour 10k HTVA:  
 
https://www.apple.com/fr/shop/buy-m [...] o-stockage
 
Ou  
 
2x https://www.alternate.fr/ASUS/Ascen [...] /100166008

Dezerd

speedboyz30 a écrit :

 

2 DGX Spark
3 DGX Spark
4 DGX Spark

 

[:zyzz:2]

 

Tu devrais avoir assez je pense  [:la chancla:5]

 



 
speedboyz30 a écrit :

 

Y a pas mieux pour ça.

 

Une conf maison pour 10 users avec 8k de budget [:leve le pied jeannot:4]


Et ouais.. Dans les fait c'est 10k€ max. [:julm3]  
C'est pour ça que je le considère plus comme une POC qu'autre chose..

 


speedboyz30

neo world a écrit :

au petit power user (strix halo, 5090 / 3090 x2 / GB10 / MAC avec une puce Max en 64 / 128GB pour Qwen 3.8 flash next au power user fortuné (rtx6000 pro, Mac m5 Ultra pour GLM 5.3 ou deepseek flash 4.1) aux modèles pro fortunés (H100, h200, GB… pour deepseek flash 4.1 voir Kimi k3 si y’a vraiment beaucoup de cartes :o )


 
Go!
 
Moi ce que j'ai en tête à la grosse louche :
 
Strix Halo 128GB 2800 euros: Entrée de gamme
Strix Halo 192GB 7000 euros: touchage de nouille useless
GB10 128GB 4900 euros: AI Inference server + CUDA + évolutivité & forte concurrence de calcul
Mac Studio 128GB 6200 euros: Sweet Spot AI server all-in one + workstation

neo world

the_fennec a écrit :


 
Ça serait bien, mais difficile et déprimant a maintenir :o


Je suis assez d’accord. En fait y’a plein de points d’entrée différents et globalement les tarifs bougent trop (à la hausse) pour faire une bonne liste.
 
Je peux faire un poste avec 5 ou 6 modèles de l’entrée de gamme interessant (BC250 / RTX5060 16gb)avec Qwen 3.6 MoU ou 3.8 27b au petit power user (strix halo, 5090 / 3090 x2 / GB10 / MAC avec une puce Max en 64 / 128GB pour Qwen 3.8 flash next au power user fortuné (rtx6000 pro, Mac m5 Ultra pour GLM 5.3 ou deepseek flash 4.1) aux modèles pro fortunés (H100, h200, GB… pour deepseek flash 4.1 voir Kimi k3 si y’a vraiment beaucoup de cartes :o )
 
Les prix bougent tout le temps, tu as du bidouillage à plein de niveaux possibles (remplacer les puces mémoire, empiler les cartes et les machines, destager une partie en RAM voir Nvme) mais c’est la foire à la saucisse avec des résultats très variables

speedboyz30

Dezerd a écrit :


J'ai oublié de préciser un truc évolutif ^^

 

2 DGX Spark
3 DGX Spark
4 DGX Spark

 

[:zyzz:2]

 

Tu devrais avoir assez je pense  [:la chancla:5]

 


Dezerd a écrit :

Salut à tous,
Fans le cadre d'un projet "POC" d'un Rag + vive coding, je cherche à monter un serveur / PC.
Budget de 8k€ (...)
Le machin sera multi user (10 personnes).

je débute dans la compréhension du concept.
Y'a des tips a prendre en compte pour pas faire n'imp ?
J'ai demandé aux IA qui pousse une conf maison à base de 4090 d'occaz(x2) ou une 5090.
Merci

 

Y a pas mieux pour ça.

 

Une conf maison pour 10 users avec 8k de budget [:leve le pied jeannot:4]

the_fennec

croustx a écrit :

Dites,
 
Faudrait se faire une liste "meilleur rapport VRAM/prix" du matos dispo.
 
Genre "pour 800€, j'ai de la RTX3090 sur leboncoin"


 
Ça serait bien, mais difficile et déprimant a maintenir :o

moyen_moins Faut demander à alanou (cf. page précédente) :spamafote:
croustx

moyen_moins a écrit :


cherche v620 et alanoo sur lbc :o


 
Tu fais un prix pour l'élite HFR ? :o

croustx

Dezerd a écrit :


J'ai oublié de préciser un truc évolutif ^^


 
Un deuxième DGX Spark quand tu aura besoin d'évoluer :o

moyen_moins


cherche v620 et alanoo sur lbc :o

Dezerd

croustx a écrit :


 
 
DGX Spark et basta


J'ai oublié de préciser un truc évolutif ^^

Dezerd

moyen_moins a écrit :


Le pc d'alanou sur lbc :o


Link ? :o

moyen_moins

Dezerd a écrit :

Salut à tous,
Fans le cadre d'un projet "POC" d'un Rag + vive coding, je cherche à monter un serveur / PC.
Budget de 8k€ (...)
Le machin sera multi user (10 personnes).
je débute dans la compréhension du concept.
Y'a des tips a prendre en compte pour pas faire n'imp ?
J'ai demandé aux IA qui pousse une conf maison à base de 4090 d'occaz(x2) ou une 5090.
Merci


Le pc d'alanou sur lbc :o

croustx

Dezerd a écrit :

Salut à tous,
Fans le cadre d'un projet "POC" d'un Rag + vive coding, je cherche à monter un serveur / PC.
Budget de 8k€ (...)
Le machin sera multi user (10 personnes).
je débute dans la compréhension du concept.
Y'a des tips a prendre en compte pour pas faire n'imp ?
J'ai demandé aux IA qui pousse une conf maison à base de 4090 d'occaz(x2) ou une 5090.
Merci


 
 
DGX Spark et basta

Dezerd Salut à tous,
Fans le cadre d'un projet "POC" d'un Rag + vive coding, je cherche à monter un serveur / PC.
Budget de 8k€ (...)
Le machin sera multi user (10 personnes).
je débute dans la compréhension du concept.
Y'a des tips a prendre en compte pour pas faire n'imp ?
J'ai demandé aux IA qui pousse une conf maison à base de 4090 d'occaz(x2) ou une 5090.
Merci
croustx Dites,
 
Faudrait se faire une liste "meilleur rapport VRAM/prix" du matos dispo.
 
Genre "pour 800€, j'ai de la RTX3090 sur leboncoin"
moyen_moins c'est le genre de modèle à tout faire en ce qui me concerne (edit : en théorie peu rebooté, recherche améliorée, connexion HA et petits problèmes genre macro excel), pour les trucs "complexes" je me replie sur un qwen 3.8 27B sur ma config.

 

mais je garderai ton post à l'esprit quand je ferai les tests ce soir ou demain :jap:

the_fennec

neo world a écrit :

Pouce légèrement le voltage plus haut : ça augmente la consommation mais ça peut éventuellement aider à stabiliser le bousin. Tu as fait tourner un memtest / occt pour voir si ça relevait une erreur après 30 minutes / une heure ? Ton symptôme ressemble aussi à celui d’un oom ^^


 
J'avais déjà le soucis avec les voltages par défaut, et je l'ai plus en repassant a 24CU. Pas con le memtest/occt, il faut que je scripte l'activation/desactivation des CU, en plus avec bc250-cu-live-manager.sh, pas besoin de reboot!
 

moyen_moins a écrit :

par contre cette nuit ( :o ), j'ai continué à tester le setup bc-250 et je pense qu'il faut que je lève le pied sur la quantization du kv cache du ornith 35B unsloth (que je préfère au qwen 3.6 35B) : q8/q4 j'ai des bizarreries lors de la génération (pas fréquentes mais suffisamment pour que je m'en aperçoive).
du genre caractère chinois au milieu d'un mot, mot "inventé" mais très proche de ce qu'il cherche à dire (habilité => habilisé) [:paysan]
 
bon déjà le quant en iq4_xs est bien sans plus mais là... a priori ça continue de passer max contexte (256K) avec du q8/q5_1 et voir à l'utilisation ce qu'il en ressort.
 
j'ai aussi trouvé du atomic chat en iq4_xs un poil plus gros et avec de meilleurs métriques mais le kv cache passe tout juste en taille max (faut pas que ça swape sinon ça devient leennnt) et leur mix iq4_xs_q4_k me fait perdre pas mal (140K max de contexte a priori) [:paysan]²


 
Perso je reste toujours en q8/q8, toucher les valeur ne fait rien gagner avec Qwen.
Avec les Ornith/AtomicChat ça fini toujours par ce genre de bizarreries, ces quants sont bon pour faire une vidéo Youtube, mais si tu les laisses bosser longtemps ça foire. A coté de ça j'ai laisser les Unloth bosser presque une semaine sans un seul tool call foiré ou mots de travers.
 
D'ailleurs si tu prompt en français tu auras plus de soucis qu'en anglais, les Ornith/AtomicChat sont majoritairement fait et utilisés par des anglophones.

moyen_moins j'ai le k en q8, le v en q5_1. je sais pas si llama.cpp prend le q6 en quant sur le kv cache [:transparency]
je vais regarder tiens :)
Pipould's

moyen_moins a écrit :

par contre cette nuit ( :o ), j'ai continué à tester le setup bc-250 et je pense qu'il faut que je lève le pied sur la quantization du kv cache du ornith 35B unsloth (que je préfère au qwen 3.6 35B) : q8/q4 j'ai des bizarreries lors de la génération (pas fréquentes mais suffisamment pour que je m'en aperçoive).
du genre caractère chinois au milieu d'un mot, mot "inventé" mais très proche de ce qu'il cherche à dire (habilité => habilisé) [:paysan]
 
bon déjà le quant en iq4_xs est bien sans plus mais là... a priori ça continue de passer max contexte (256K) avec du q8/q5_1 et voir à l'utilisation ce qu'il en ressort.
 
j'ai aussi trouvé du atomic chat en iq4_xs un poil plus gros et avec de meilleurs métriques mais le kv cache passe tout juste en taille max (faut pas que ça swape sinon ça devient leennnt) et leur mix iq4_xs_q4_k me fait perdre pas mal (140K max de contexte a priori) [:paysan]²


 
Si tu peux, je recommande quand meme du Q6/Q8, quitte a sacrifier de la vitesse. Pour un contexte de 262k.  
 
Si tu as <128k de contexte, oui tu peux viser le Q4.  
 
Pour de la prod biensur.

moyen_moins par contre cette nuit ( :o ), j'ai continué à tester le setup bc-250 et je pense qu'il faut que je lève le pied sur la quantization du kv cache du ornith 35B unsloth (que je préfère au qwen 3.6 35B) : q8/q4 j'ai des bizarreries lors de la génération (pas fréquentes mais suffisamment pour que je m'en aperçoive).
du genre caractère chinois au milieu d'un mot, mot "inventé" mais très proche de ce qu'il cherche à dire (habilité => habilisé) [:paysan]

 

bon déjà le quant en iq4_xs est bien sans plus mais là... a priori ça continue de passer max contexte (256K) avec du q8/q5_1 et voir à l'utilisation ce qu'il en ressort.

 

j'ai aussi trouvé du atomic chat en iq4_xs un poil plus gros et avec de meilleurs métriques mais le kv cache passe tout juste en taille max (faut pas que ça swape sinon ça devient leennnt) et leur mix iq4_xs_q4_k me fait perdre pas mal (140K max de contexte a priori) [:paysan]²

neo world

moyen_moins a écrit :


t'inquiètes, je peux au moins en caser 2 ou 3 ici. :whistle:


Je dépanne aussi si besoin :o

neo world

alanou a écrit :


 
Après évidemment, sinon j'en aurais 8 ou plus :o
Mais elles étaient encore "que" à 1400$, pour des versions unlock testé et mod PCIe 16x (condensateurs soudés).
 
Sinon au total je dois être vers les 15k€ jusqu'ici, mais je vais en récupérer un peu en revendant les Lenovo P620 (celui avec les V620 et celui avec les 3090).


Merci :jap:
 
Quels sont tes plans en matière de besoin d’IA ? :D

neo world

the_fennec a écrit :


 
Si c'est pour moi, j'avais déjà un plantage avant d'UV.
Quand elle plante on peut plus faire grand-chose, si j'ai un ssh encore dessus je peux faire des ls/ps mais souvent ça revient pas, je peux même pas reboot, le kernel est en vrac.
 


 
Pouce légèrement le voltage plus haut : ça augmente la consommation mais ça peut éventuellement aider à stabiliser le bousin. Tu as fait tourner un memtest / occt pour voir si ça relevait une erreur après 30 minutes / une heure ? Ton symptôme ressemble aussi à celui d’un oom ^^

moyen_moins

Pipould's a écrit :


 
Attends, jai pas assez de pc pour les mettre...
 
https://i.ibb.co/fVnn6GZ9/IMG-20260921-192247.jpg
 
 :O


t'inquiètes, je peux au moins en caser 2 ou 3 ici. :whistle:

Pipould's

alanou a écrit :


 
Switch PLX bientôt ?


 
Bonne question...  
 
Je me tatte en en mettre 2 dans une boite avec un CM en micro ATX...  
 
Les 4 feraient du q38fn et celle avec les 2 du 27b...

alanou

Pipould's a écrit :


 
Attends, jai pas assez de pc pour les mettre...
 
https://i.ibb.co/fVnn6GZ9/IMG-20260921-192247.jpg
 
 :O


 
Switch PLX bientôt ?

Tronklou Ca manque de scotch papier, Tronklou not approved
Pipould's

moyen_moins a écrit :

vous faites des jaloux les mecs là :o

 

Attends, jai pas assez de pc pour les mettre...

 

https://i.ibb.co/fVnn6GZ9/IMG-20260921-192247.jpg

 

:O

moyen_moins vous faites des jaloux les mecs là :o
Pipould's De mon cote j'en suis la:
 
https://i.ibb.co/Kc7QCNhT/image.png
https://i.ibb.co/4wJXGrtW/image.png
 
J'ai toujours pas recu les M.2 -> PCIE5 4x.  
 
Sinon en terme de generation / prefill, ca boost...
 
Sinon mon setup a base de strix / halogen je le considere production grade, il tourne sans soucis.
alanou

Pipould's a écrit :


 
Pas mal, j'ai hesite ^^
 
Tu as combien en prefill / generation sur q38fn ?


 
Sur les cmp pas encore testé parceque pour le moment j’en ai monté que 2 (j’attends l’alimentation et le radia pour la CM Epyc)
 
J’ai juste monté les CMP 2 par 2 dans le Lenovo pour valider l’unlock et la stabilité  
 
https://img3.super-h.fr/images/2026 [...] 652100.jpg

Pipould's


 
Pas mal, j'ai hesite ^^
 
Tu as combien en prefill / generation sur q38fn ?

alanou

Pipould's a écrit :


 
+1  
 
Les V620 sont introuvables en Europe...  
 
Les cmp170 c'est la roulette russe... T'as réussi à les trouver ou ? Tu les as complètement débloquées ?


 
Ouaip pas de soucis  
 
Alibaba
 
https://img3.super-h.fr/images/2026 [...] 857000.jpg

Pipould's

moyen_moins a écrit :

t'as réussi à trouver des V620 en Europe ? [:wam]

 

edit: j'ai raté le passage sur les 4x170HX [:wam]²²²

 

+1

 

Les V620 sont introuvables en Europe...

 

Les cmp170 c'est la roulette russe... T'as réussi à les trouver ou ? Tu les as complètement débloquées ?

Bitman

Citation :

Created: 2026-09-28 16:21
Last Activity: 2026-09-28 20:19
Model: qwen3.8:27b-mlx (custom)
Context: 130,429 / 262,144 (50%)
Lifetime tokens billed: 1,489,639


 
ca fait un paquet de tokens pour un truc en ligne depuis quelques heures non ? :D


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)