Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
7310 connectés 

 


Je génère ...


 
8.3 %
 2 votes
1.  moins de 100k tokens par jour
 
 
4.2 %
 1 vote
2.  entre 100k et 500k tokens par jour
 
 
8.3 %
 2 votes
3.  Entre 500 et 1M de tokens par jour
 
 
8.3 %
 2 votes
4.  Entre 1M et 5M de tokens par jour
 
 
4.2 %
 1 vote
5.  5M+
 
 
12.5 %
 3 votes
6.  10M+
 
 
20.8 %
 5 votes
7.  La quantité c'est dans la tête, tout est dans la qualité du jeton
 
 
20.8 %
 5 votes
8.  Quand on aime on ne compte pas (j'en ait aucune idée :o )
 
 
4.2 %
 1 vote
9.  C'est quoi ce token maxing de merde ? je dedrap le topic !
 
 
8.3 %
 2 votes
10.  zero, je lurke et je produis mon token seulement biologiquement
 

Total : 25 votes (1 vote blanc)
Sondage à 3 choix possibles.
Ce sondage est clos, vous ne pouvez plus voter
 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  72  73  74  75  76  77
Page Suivante
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°51244
Bitman
STAY APART
Posté le 28-09-2026 à 20:37:08  profilanswer
 

Reprise du message précédent :

Citation :

Created: 2026-09-28 16:21
Last Activity: 2026-09-28 20:19
Model: qwen3.8:27b-mlx (custom)
Context: 130,429 / 262,144 (50%)
Lifetime tokens billed: 1,489,639


 
ca fait un paquet de tokens pour un truc en ligne depuis quelques heures non ? :D

n°51247
Pipould's
Posté le 28-09-2026 à 21:04:28  profilanswer
 

moyen_moins a écrit :

t'as réussi à trouver des V620 en Europe ? [:wam]

 

edit: j'ai raté le passage sur les 4x170HX [:wam]²²²

 

+1

 

Les V620 sont introuvables en Europe...

 

Les cmp170 c'est la roulette russe... T'as réussi à les trouver ou ? Tu les as complètement débloquées ?

n°51249
alanou
Remembering M.P.
Posté le 28-09-2026 à 21:28:31  profilanswer
 

Pipould's a écrit :


 
+1  
 
Les V620 sont introuvables en Europe...  
 
Les cmp170 c'est la roulette russe... T'as réussi à les trouver ou ? Tu les as complètement débloquées ?


 
Ouaip pas de soucis  
 
Alibaba
 
https://img3.super-h.fr/images/2026/09/28/snapshot_8402200315121857000.jpg

Message cité 1 fois
Message édité par alanou le 28-09-2026 à 21:33:17

---------------
Bolidage tête rouge - ateliers certifiés ISO0069
n°51254
Pipould's
Posté le 28-09-2026 à 21:35:09  profilanswer
 


 
Pas mal, j'ai hesite ^^
 
Tu as combien en prefill / generation sur q38fn ?

n°51256
alanou
Remembering M.P.
Posté le 28-09-2026 à 21:39:06  profilanswer
 

Pipould's a écrit :


 
Pas mal, j'ai hesite ^^
 
Tu as combien en prefill / generation sur q38fn ?


 
Sur les cmp pas encore testé parceque pour le moment j’en ai monté que 2 (j’attends l’alimentation et le radia pour la CM Epyc)
 
J’ai juste monté les CMP 2 par 2 dans le Lenovo pour valider l’unlock et la stabilité  
 
https://img3.super-h.fr/images/2026/09/28/snapshot_8290354712500652100.jpg


---------------
Bolidage tête rouge - ateliers certifiés ISO0069
n°51258
Pipould's
Posté le 28-09-2026 à 22:04:07  profilanswer
 

De mon cote j'en suis la:
 
https://i.ibb.co/Kc7QCNhT/image.png
https://i.ibb.co/4wJXGrtW/image.png
 
J'ai toujours pas recu les M.2 -> PCIE5 4x.  
 
Sinon en terme de generation / prefill, ca boost...
 
Sinon mon setup a base de strix / halogen je le considere production grade, il tourne sans soucis.


Message édité par Pipould's le 28-09-2026 à 22:05:57
n°51259
moyen_moin​s
chat réincarné
Posté le 28-09-2026 à 22:12:12  profilanswer
 

vous faites des jaloux les mecs là :o

n°51261
Pipould's
Posté le 28-09-2026 à 22:20:20  profilanswer
 

moyen_moins a écrit :

vous faites des jaloux les mecs là :o

 

Attends, jai pas assez de pc pour les mettre...

 

https://i.ibb.co/fVnn6GZ9/IMG-20260921-192247.jpg

 

:O

n°51267
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 28-09-2026 à 22:48:08  profilanswer
 

Ca manque de scotch papier, Tronklou not approved


---------------
Victime de girafophobie, mais se soigne.
n°51268
alanou
Remembering M.P.
Posté le 28-09-2026 à 22:50:08  profilanswer
 

Pipould's a écrit :


 
Attends, jai pas assez de pc pour les mettre...
 
https://i.ibb.co/fVnn6GZ9/IMG-20260921-192247.jpg
 
 :O


 
Switch PLX bientôt ?


---------------
Bolidage tête rouge - ateliers certifiés ISO0069
n°51271
Pipould's
Posté le 28-09-2026 à 23:01:42  profilanswer
 

alanou a écrit :


 
Switch PLX bientôt ?


 
Bonne question...  
 
Je me tatte en en mettre 2 dans une boite avec un CM en micro ATX...  
 
Les 4 feraient du q38fn et celle avec les 2 du 27b...

n°51276
moyen_moin​s
chat réincarné
Posté le 29-09-2026 à 00:14:25  profilanswer
 

Pipould's a écrit :


 
Attends, jai pas assez de pc pour les mettre...
 
https://i.ibb.co/fVnn6GZ9/IMG-20260921-192247.jpg
 
 :O


t'inquiètes, je peux au moins en caser 2 ou 3 ici. :whistle:

n°51307
neo world
Posté le 29-09-2026 à 09:15:25  profilanswer
 

the_fennec a écrit :


 
Si c'est pour moi, j'avais déjà un plantage avant d'UV.
Quand elle plante on peut plus faire grand-chose, si j'ai un ssh encore dessus je peux faire des ls/ps mais souvent ça revient pas, je peux même pas reboot, le kernel est en vrac.
 


 
Pouce légèrement le voltage plus haut : ça augmente la consommation mais ça peut éventuellement aider à stabiliser le bousin. Tu as fait tourner un memtest / occt pour voir si ça relevait une erreur après 30 minutes / une heure ? Ton symptôme ressemble aussi à celui d’un oom ^^

n°51309
neo world
Posté le 29-09-2026 à 09:16:35  profilanswer
 

alanou a écrit :


 
Après évidemment, sinon j'en aurais 8 ou plus :o
Mais elles étaient encore "que" à 1400$, pour des versions unlock testé et mod PCIe 16x (condensateurs soudés).
 
Sinon au total je dois être vers les 15k€ jusqu'ici, mais je vais en récupérer un peu en revendant les Lenovo P620 (celui avec les V620 et celui avec les 3090).


Merci :jap:
 
Quels sont tes plans en matière de besoin d’IA ? :D

n°51310
neo world
Posté le 29-09-2026 à 09:18:01  profilanswer
 

moyen_moins a écrit :


t'inquiètes, je peux au moins en caser 2 ou 3 ici. :whistle:


Je dépanne aussi si besoin :o

n°51342
moyen_moin​s
chat réincarné
Posté le 29-09-2026 à 11:07:04  profilanswer
 

par contre cette nuit ( :o ), j'ai continué à tester le setup bc-250 et je pense qu'il faut que je lève le pied sur la quantization du kv cache du ornith 35B unsloth (que je préfère au qwen 3.6 35B) : q8/q4 j'ai des bizarreries lors de la génération (pas fréquentes mais suffisamment pour que je m'en aperçoive).
du genre caractère chinois au milieu d'un mot, mot "inventé" mais très proche de ce qu'il cherche à dire (habilité => habilisé) [:paysan]

 

bon déjà le quant en iq4_xs est bien sans plus mais là... a priori ça continue de passer max contexte (256K) avec du q8/q5_1 et voir à l'utilisation ce qu'il en ressort.

 

j'ai aussi trouvé du atomic chat en iq4_xs un poil plus gros et avec de meilleurs métriques mais le kv cache passe tout juste en taille max (faut pas que ça swape sinon ça devient leennnt) et leur mix iq4_xs_q4_k me fait perdre pas mal (140K max de contexte a priori) [:paysan]²

Message cité 2 fois
Message édité par moyen_moins le 29-09-2026 à 11:08:03
n°51349
Pipould's
Posté le 29-09-2026 à 11:26:24  profilanswer
 

moyen_moins a écrit :

par contre cette nuit ( :o ), j'ai continué à tester le setup bc-250 et je pense qu'il faut que je lève le pied sur la quantization du kv cache du ornith 35B unsloth (que je préfère au qwen 3.6 35B) : q8/q4 j'ai des bizarreries lors de la génération (pas fréquentes mais suffisamment pour que je m'en aperçoive).
du genre caractère chinois au milieu d'un mot, mot "inventé" mais très proche de ce qu'il cherche à dire (habilité => habilisé) [:paysan]
 
bon déjà le quant en iq4_xs est bien sans plus mais là... a priori ça continue de passer max contexte (256K) avec du q8/q5_1 et voir à l'utilisation ce qu'il en ressort.
 
j'ai aussi trouvé du atomic chat en iq4_xs un poil plus gros et avec de meilleurs métriques mais le kv cache passe tout juste en taille max (faut pas que ça swape sinon ça devient leennnt) et leur mix iq4_xs_q4_k me fait perdre pas mal (140K max de contexte a priori) [:paysan]²


 
Si tu peux, je recommande quand meme du Q6/Q8, quitte a sacrifier de la vitesse. Pour un contexte de 262k.  
 
Si tu as <128k de contexte, oui tu peux viser le Q4.  
 
Pour de la prod biensur.

n°51350
moyen_moin​s
chat réincarné
Posté le 29-09-2026 à 11:33:05  profilanswer
 

j'ai le k en q8, le v en q5_1. je sais pas si llama.cpp prend le q6 en quant sur le kv cache [:transparency]
je vais regarder tiens :)

n°51353
the_fennec
f3nn3cUs z3rd4
Posté le 29-09-2026 à 11:49:31  profilanswer
 

neo world a écrit :

Pouce légèrement le voltage plus haut : ça augmente la consommation mais ça peut éventuellement aider à stabiliser le bousin. Tu as fait tourner un memtest / occt pour voir si ça relevait une erreur après 30 minutes / une heure ? Ton symptôme ressemble aussi à celui d’un oom ^^


 
J'avais déjà le soucis avec les voltages par défaut, et je l'ai plus en repassant a 24CU. Pas con le memtest/occt, il faut que je scripte l'activation/desactivation des CU, en plus avec bc250-cu-live-manager.sh, pas besoin de reboot!
 

moyen_moins a écrit :

par contre cette nuit ( :o ), j'ai continué à tester le setup bc-250 et je pense qu'il faut que je lève le pied sur la quantization du kv cache du ornith 35B unsloth (que je préfère au qwen 3.6 35B) : q8/q4 j'ai des bizarreries lors de la génération (pas fréquentes mais suffisamment pour que je m'en aperçoive).
du genre caractère chinois au milieu d'un mot, mot "inventé" mais très proche de ce qu'il cherche à dire (habilité => habilisé) [:paysan]
 
bon déjà le quant en iq4_xs est bien sans plus mais là... a priori ça continue de passer max contexte (256K) avec du q8/q5_1 et voir à l'utilisation ce qu'il en ressort.
 
j'ai aussi trouvé du atomic chat en iq4_xs un poil plus gros et avec de meilleurs métriques mais le kv cache passe tout juste en taille max (faut pas que ça swape sinon ça devient leennnt) et leur mix iq4_xs_q4_k me fait perdre pas mal (140K max de contexte a priori) [:paysan]²


 
Perso je reste toujours en q8/q8, toucher les valeur ne fait rien gagner avec Qwen.
Avec les Ornith/AtomicChat ça fini toujours par ce genre de bizarreries, ces quants sont bon pour faire une vidéo Youtube, mais si tu les laisses bosser longtemps ça foire. A coté de ça j'ai laisser les Unloth bosser presque une semaine sans un seul tool call foiré ou mots de travers.
 
D'ailleurs si tu prompt en français tu auras plus de soucis qu'en anglais, les Ornith/AtomicChat sont majoritairement fait et utilisés par des anglophones.


---------------
Faudra que je teste un jour :o
n°51363
moyen_moin​s
chat réincarné
Posté le 29-09-2026 à 12:59:49  profilanswer
 

c'est le genre de modèle à tout faire en ce qui me concerne (edit : en théorie peu rebooté, recherche améliorée, connexion HA et petits problèmes genre macro excel), pour les trucs "complexes" je me replie sur un qwen 3.8 27B sur ma config.

 

mais je garderai ton post à l'esprit quand je ferai les tests ce soir ou demain :jap:


Message édité par moyen_moins le 29-09-2026 à 13:01:47
n°51377
croustx
Modoadorateur
Posté le 29-09-2026 à 14:46:06  profilanswer
 

Dites,
 
Faudrait se faire une liste "meilleur rapport VRAM/prix" du matos dispo.
 
Genre "pour 800€, j'ai de la RTX3090 sur leboncoin"

n°51382
Dezerd
Posté le 29-09-2026 à 14:56:26  profilanswer
 

Salut à tous,
Fans le cadre d'un projet "POC" d'un Rag + vive coding, je cherche à monter un serveur / PC.
Budget de 8k€ (...)
Le machin sera multi user (10 personnes).
je débute dans la compréhension du concept.
Y'a des tips a prendre en compte pour pas faire n'imp ?
J'ai demandé aux IA qui pousse une conf maison à base de 4090 d'occaz(x2) ou une 5090.
Merci


---------------
503 Service Unavailable
n°51390
croustx
Modoadorateur
Posté le 29-09-2026 à 15:14:13  profilanswer
 

Dezerd a écrit :

Salut à tous,
Fans le cadre d'un projet "POC" d'un Rag + vive coding, je cherche à monter un serveur / PC.
Budget de 8k€ (...)
Le machin sera multi user (10 personnes).
je débute dans la compréhension du concept.
Y'a des tips a prendre en compte pour pas faire n'imp ?
J'ai demandé aux IA qui pousse une conf maison à base de 4090 d'occaz(x2) ou une 5090.
Merci


 
 
DGX Spark et basta

n°51400
moyen_moin​s
chat réincarné
Posté le 29-09-2026 à 15:44:56  profilanswer
 

Dezerd a écrit :

Salut à tous,
Fans le cadre d'un projet "POC" d'un Rag + vive coding, je cherche à monter un serveur / PC.
Budget de 8k€ (...)
Le machin sera multi user (10 personnes).
je débute dans la compréhension du concept.
Y'a des tips a prendre en compte pour pas faire n'imp ?
J'ai demandé aux IA qui pousse une conf maison à base de 4090 d'occaz(x2) ou une 5090.
Merci


Le pc d'alanou sur lbc :o

n°51401
Dezerd
Posté le 29-09-2026 à 15:49:03  profilanswer
 

moyen_moins a écrit :


Le pc d'alanou sur lbc :o


Link ? :o


---------------
503 Service Unavailable
n°51402
Dezerd
Posté le 29-09-2026 à 15:49:40  profilanswer
 

croustx a écrit :


 
 
DGX Spark et basta


J'ai oublié de préciser un truc évolutif ^^


---------------
503 Service Unavailable
n°51405
moyen_moin​s
chat réincarné
Posté le 29-09-2026 à 15:58:06  profilanswer
 


cherche v620 et alanoo sur lbc :o

n°51407
croustx
Modoadorateur
Posté le 29-09-2026 à 16:18:38  profilanswer
 

Dezerd a écrit :


J'ai oublié de préciser un truc évolutif ^^


 
Un deuxième DGX Spark quand tu aura besoin d'évoluer :o

n°51408
croustx
Modoadorateur
Posté le 29-09-2026 à 16:20:54  profilanswer
 

moyen_moins a écrit :


cherche v620 et alanoo sur lbc :o


 
Tu fais un prix pour l'élite HFR ? :o

n°51413
moyen_moin​s
chat réincarné
Posté le 29-09-2026 à 16:43:02  profilanswer
 

Faut demander à alanou (cf. page précédente) :spamafote:

n°51420
the_fennec
f3nn3cUs z3rd4
Posté le 29-09-2026 à 17:08:17  profilanswer
 

croustx a écrit :

Dites,
 
Faudrait se faire une liste "meilleur rapport VRAM/prix" du matos dispo.
 
Genre "pour 800€, j'ai de la RTX3090 sur leboncoin"


 
Ça serait bien, mais difficile et déprimant a maintenir :o


---------------
Faudra que je teste un jour :o
n°51425
speedboyz3​0
Guide Michelin :o
Posté le 29-09-2026 à 17:21:25  profilanswer
 

Dezerd a écrit :


J'ai oublié de préciser un truc évolutif ^^

 

2 DGX Spark
3 DGX Spark
4 DGX Spark

 

[:zyzz:2]

 

Tu devrais avoir assez je pense  [:la chancla:5]

 


Dezerd a écrit :

Salut à tous,
Fans le cadre d'un projet "POC" d'un Rag + vive coding, je cherche à monter un serveur / PC.
Budget de 8k€ (...)
Le machin sera multi user (10 personnes).

je débute dans la compréhension du concept.
Y'a des tips a prendre en compte pour pas faire n'imp ?
J'ai demandé aux IA qui pousse une conf maison à base de 4090 d'occaz(x2) ou une 5090.
Merci

 

Y a pas mieux pour ça.

 

Une conf maison pour 10 users avec 8k de budget [:leve le pied jeannot:4]

Message cité 1 fois
Message édité par speedboyz30 le 29-09-2026 à 17:36:24
n°51427
neo world
Posté le 29-09-2026 à 17:28:14  profilanswer
 

the_fennec a écrit :


 
Ça serait bien, mais difficile et déprimant a maintenir :o


Je suis assez d’accord. En fait y’a plein de points d’entrée différents et globalement les tarifs bougent trop (à la hausse) pour faire une bonne liste.
 
Je peux faire un poste avec 5 ou 6 modèles de l’entrée de gamme interessant (BC250 / RTX5060 16gb)avec Qwen 3.6 MoU ou 3.8 27b au petit power user (strix halo, 5090 / 3090 x2 / GB10 / MAC avec une puce Max en 64 / 128GB pour Qwen 3.8 flash next au power user fortuné (rtx6000 pro, Mac m5 Ultra pour GLM 5.3 ou deepseek flash 4.1) aux modèles pro fortunés (H100, h200, GB… pour deepseek flash 4.1 voir Kimi k3 si y’a vraiment beaucoup de cartes :o )
 
Les prix bougent tout le temps, tu as du bidouillage à plein de niveaux possibles (remplacer les puces mémoire, empiler les cartes et les machines, destager une partie en RAM voir Nvme) mais c’est la foire à la saucisse avec des résultats très variables

n°51430
speedboyz3​0
Guide Michelin :o
Posté le 29-09-2026 à 17:40:57  profilanswer
 

neo world a écrit :

au petit power user (strix halo, 5090 / 3090 x2 / GB10 / MAC avec une puce Max en 64 / 128GB pour Qwen 3.8 flash next au power user fortuné (rtx6000 pro, Mac m5 Ultra pour GLM 5.3 ou deepseek flash 4.1) aux modèles pro fortunés (H100, h200, GB… pour deepseek flash 4.1 voir Kimi k3 si y’a vraiment beaucoup de cartes :o )


 
Go!
 
Moi ce que j'ai en tête à la grosse louche :
 
Strix Halo 128GB 2800 euros: Entrée de gamme
Strix Halo 192GB 7000 euros: touchage de nouille useless
GB10 128GB 4900 euros: AI Inference server + CUDA + évolutivité & forte concurrence de calcul
Mac Studio 128GB 6200 euros: Sweet Spot AI server all-in one + workstation

n°51432
Dezerd
Posté le 29-09-2026 à 17:45:21  profilanswer
 

speedboyz30 a écrit :

 

2 DGX Spark
3 DGX Spark
4 DGX Spark

 

[:zyzz:2]

 

Tu devrais avoir assez je pense  [:la chancla:5]

 



 
speedboyz30 a écrit :

 

Y a pas mieux pour ça.

 

Une conf maison pour 10 users avec 8k de budget [:leve le pied jeannot:4]


Et ouais.. Dans les fait c'est 10k€ max. [:julm3]  
C'est pour ça que je le considère plus comme une POC qu'autre chose..

 



---------------
503 Service Unavailable
n°51440
speedboyz3​0
Guide Michelin :o
Posté le 29-09-2026 à 18:32:48  profilanswer
 

Dezerd a écrit :


Et ouais.. Dans les fait c'est 10k€ max. [:julm3]  
C'est pour ça que je le considère plus comme une POC qu'autre chose..  


 
pour 10k HTVA:  
 
https://www.apple.com/fr/shop/buy-m [...] o-stockage
 
Ou  
 
2x https://www.alternate.fr/ASUS/Ascen [...] /100166008

n°51592
neo world
Posté le 29-09-2026 à 23:48:38  profilanswer
 

pour les accros d'halogen :  
https://github.com/gufo-org/gufo  
 
ne migrez pas tout de suite : c'est open source et les perfs sont encore meilleures mais le kv cache semble pas tout à fait au point encore :
https://github.com/gufo-org/gufo/issues
 
https://i.redd.it/9lw4fgl6a6sh1.png
 


Message édité par neo world le 30-09-2026 à 00:24:40
n°51593
neo world
Posté le 29-09-2026 à 23:51:33  profilanswer
 

AMD propose de desserrer le frein à main sur ses  igpu avec le kernel linux 7.4 :
https://www.phoronix.com/review/amd-perfopt
 

Citation :

AMD's new PerfOpt feature being introduced in Linux 7.4 is set to provide some solid gains as shown in these benchmarks today across different AMD Ryzen/Radeon hardware.


 
en version 8.X on pourra peut peut être aussi détacher l'enclume et le fer à repasser  [:perco_35:2] :o

Message cité 1 fois
Message édité par neo world le 30-09-2026 à 00:02:11
n°51622
the_fennec
f3nn3cUs z3rd4
Posté le 30-09-2026 à 08:15:45  profilanswer
 

neo world a écrit :

AMD propose de desserrer le frein à main sur ses  igpu avec le kernel linux 7.4 :
https://www.phoronix.com/review/amd-perfopt
 

Citation :

AMD's new PerfOpt feature being introduced in Linux 7.4 is set to provide some solid gains as shown in these benchmarks today across different AMD Ryzen/Radeon hardware.


 
en version 8.X on pourra peut peut être aussi détacher l'enclume et le fer à repasser  [:perco_35:2] :o


 
Tous les gains sont bons a prendre :jap:
Facilement 2 TG/s sur Strix et 4/5 sur un laptop en carton :love:


---------------
Faudra que je teste un jour :o
 Page :   1  2  3  4  5  ..  72  73  74  75  76  77
Page Suivante

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)