Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
3480 connectés 

 


Je génère ...
Sondage à 3 choix possibles.
Ce sondage expirera le 20-09-2026 à 10:00




Attention si vous cliquez sur "voir les résultats" vous ne pourrez plus voter

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  53  54  55  ..  57  58  59  60  61  62
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°47111
AllenMadis​on
Oracle du Keb's
Posté le 01-09-2026 à 15:01:32  profilanswer
 

Reprise du message précédent :
Est-ce que quelqu'un ici a un serveur avec au moins 192 ou 320go de ram pour effectuer un calcul python et me rendre un petit service ? :o

 

En dessous c'est mort, et mes 32go de ram sur mon pc ça va pas suffire :o

 

Oui je sais que poser cette question là en pleine pénurie de ram... :o

 

Pour les curieux, je tente de calculer de l'entropie sur une absorption de positivité de signe des nombres premiers (forme de weil pour RH) via une construction par des matrices de hadamard. Pour 1024 et 2048 matrices ça me demande respectivement entre 80 et 120go de ram / 220/320go (sans optimisations). La VM de ChatGPT n'a que 32go de ram aussi donc ça coince un peu :o

Message cité 1 fois
Message édité par AllenMadison le 01-09-2026 à 15:13:42

---------------
Nothing much to teach, man. There's ze high, there's ze low and yall still fucking miss.
n°47113
neo world
Posté le 01-09-2026 à 15:14:09  profilanswer
 

Envoie un MP à Joce. M’enfin si c’est rapide t’es pas plus mal à louer un serveur quelques minutes via les crédits gratuits d’un fournisseur quelconque :jap:

n°47120
SynE
Agri du dessert
Posté le 01-09-2026 à 15:41:18  profilanswer
 

AllenMadison a écrit :

Est-ce que quelqu'un ici a un serveur avec au moins 192 ou 320go de ram pour effectuer un calcul python et me rendre un petit service ? :o
 
En dessous c'est mort, et mes 32go de ram sur mon pc ça va pas suffire :o
 
Oui je sais que poser cette question là en pleine pénurie de ram... :o
 
Pour les curieux, je tente de calculer de l'entropie sur une absorption de positivité de signe des nombres premiers (forme de weil pour RH) via une construction par des matrices de hadamard. Pour 1024 et 2048 matrices ça me demande respectivement entre 80 et 120go de ram / 220/320go (sans optimisations). La VM de ChatGPT n'a que 32go de ram aussi donc ça coince un peu :o


 
Si tu peux attendre ce weekend, je te donne un accès sur celui que je vais rebrancher.

n°47121
neo world
Posté le 01-09-2026 à 15:42:12  profilanswer
 

[:winpoks] chapeau

n°47125
AllenMadis​on
Oracle du Keb's
Posté le 01-09-2026 à 15:55:25  profilanswer
 

SynE a écrit :


 
Si tu peux attendre ce weekend, je te donne un accès sur celui que je vais rebrancher.


 
:jap:  
 
Pas de souci ça peut attendre ce weekend, merci beaucoup, je t'enverrai un MP.


---------------
Nothing much to teach, man. There's ze high, there's ze low and yall still fucking miss.
n°47150
yohaskan
Posté le 01-09-2026 à 18:54:27  profilanswer
 

Je ne sais pas si c'est lié aux mise à jour dUnsloth studio et de son runetime llama.cpp
mais le LLM Qwen3.8-27B chargé sur son server APi semble bien moins perdre de temps a réfléchir  :heink:  :ouch:  
 

Code :
  1. Qwen3.8-Flash s'exécute avec 75 Go de RAM
  2. GLM-5.3-Flash s'exécute avec 102 Go de RAM + VRAM
  3. Déchargement de la RAM jusqu'à 5x plus rapide
  4. La compaction automatique répétée fonctionne désormais de manière fiable
  5. Plus de 100 améliorations en matière de chat, de fiabilité et de performances
  6. --------------------------------
  7. {"timestamp": "2026-09-01T16:43:19.543314Z", "level": "info", "event": "engine_stats", "gen_tok_s": 115.9, "prompt_tok_s": 99.2, "running": 0, "waiting": 0}
  8. {"timestamp": "2026-09-01T16:43:26.313690Z", "level": "info", "event": "request_completed", "method": "POST", "path": "/v1/chat/completions", "status_code": 200, "process_time_ms": 5320.67}
  9. {"timestamp": "2026-09-01T16:43:29.552715Z", "level": "info", "event": "engine_stats", "gen_tok_s": 99.5, "prompt_tok_s": 619.4, "running": 0, "waiting": 0}
  10. {"timestamp": "2026-09-01T16:43:32.047769Z", "level": "info", "event": "request_completed", "method": "POST", "path": "/v1/chat/completions", "status_code": 200, "process_time_ms": 5305.28}
  11. {"timestamp": "2026-09-01T16:43:34.853758Z", "level": "info", "event": "request_completed", "method": "POST", "path": "/v1/chat/completions", "status_code": 200, "process_time_ms": 2250.87}
  12. {"timestamp": "2026-09-01T16:43:36.809576Z", "level": "info", "event": "request_completed", "method": "POST", "path": "/v1/chat/completions", "status_code": 200, "process_time_ms": 1555.82}
  13. {"timestamp": "2026-09-01T16:43:38.662783Z", "level": "info", "event": "request_completed", "method": "POST", "path": "/v1/chat/completions", "status_code": 200, "process_time_ms": 1308.11}
  14. {"timestamp": "2026-09-01T16:43:39.574491Z", "level": "info", "event": "engine_stats", "gen_tok_s": 115.7, "prompt_tok_s": 666.3, "running": 1, "waiting": 0}
  15. {"timestamp": "2026-09-01T16:43:41.108187Z", "level": "info", "event": "request_completed", "method": "POST", "path": "/v1/chat/completions", "status_code": 200, "process_time_ms": 1980.78}
  16. {"timestamp": "2026-09-01T16:43:42.732225Z", "level": "info", "event": "request_completed", "method": "POST", "path": "/v1/chat/completions", "status_code": 200, "process_time_ms": 1226.85}
  17. {"timestamp": "2026-09-01T16:43:48.418955Z", "level": "info", "event": "request_completed", "method": "POST", "path": "/v1/chat/completions", "status_code": 200, "process_time_ms": 5325.63}
  18. {"timestamp": "2026-09-01T16:43:49.605591Z", "level": "info", "event": "engine_stats", "gen_tok_s": 113.1, "prompt_tok_s": 922.7, "running": 1, "waiting": 0}
  19. {"timestamp": "2026-09-01T16:43:51.300307Z", "level": "info", "event": "request_completed", "method": "POST", "path": "/v1/chat/completions", "status_code": 200, "process_time_ms": 2497.55}
  20. {"timestamp": "2026-09-01T16:43:57.149780Z", "level": "info", "event": "request_completed", "method": "POST", "path": "/v1/chat/completions", "status_code": 200, "process_time_ms": 5311.1}
  21. {"timestamp": "2026-09-01T16:43:59.632651Z", "level": "info", "event": "engine_stats", "gen_tok_s": 109.0, "prompt_tok_s": 729.8, "running": 1, "waiting": 0}
  22. {"timestamp": "2026-09-01T16:44:03.020861Z", "level": "info", "event": "request_completed", "method": "POST", "path": "/v1/chat/completions", "status_code": 200, "process_time_ms": 5381.44}
  23. {"timestamp": "2026-09-01T16:44:09.636784Z", "level": "info", "event": "engine_stats", "gen_tok_s": 101.4, "prompt_tok_s": 0.0, "running": 0, "waiting": 0}


 
Et il est toujours aussi performant niveau code python (d'ailleurs on vient de trouver un moyen pour activer une feature qui semblait pas faisable auparavant...)
 
ps: et son <thinking> est maintenant en français  :ouch: :  
L'utilisateur veut vérifier que tout est bien figé sur disque avant de faire une pause. Laisse-moi faire un dernier check rapide pour confirmer que tous les fichiers modifiés cette session sont bien sauvegardés.


Message édité par yohaskan le 01-09-2026 à 19:37:44
n°47192
neo world
Posté le 01-09-2026 à 22:21:45  profilanswer
 

peut être des paramètres plus adaptés. Toujours bon à prendre :D

n°47195
neo world
Posté le 01-09-2026 à 22:32:47  profilanswer
 

Décision difficile mais nécessaire ici  [:daphnehova:2]  : le strix halo quitte l'aventure du rack principal (le NAS trouve que ses disques méritent mieux que 50°C pour le disque le plus chaud) et va finir relégué au rack de la dépendance : le switch qui l'y attend se fiche de finir dans un sauna :o


Message édité par neo world le 01-09-2026 à 22:33:41
n°47199
b-tzu
Geek a toute heure...
Posté le 01-09-2026 à 23:54:57  profilanswer
 

Bon, j'ai testé qwen 3.8 27b sur le mac 24Go ca passe pas (LM Studio : pas assez de mémoire, alors que c'est eux qui m'ont recommandé ce modele adapté :o)  
Qui utilise des IA locales sur un mac 24Go, quel modele, quel parametres? lm studio ou llama.cpp ?


---------------
Topic Ventes || Topic Jeux Vidéos || Topic Téléphonie (Rien pour le moment)
n°47200
neo world
Posté le 02-09-2026 à 00:06:17  profilanswer
 

quel quantisation pour le modèle ? Tu as le qwen3.8 27b 4 bit MLX qui pèse 16Go. ça passe :D
De base ton gpu est limité à 75% de ta RAM faut lui passer
sudo sysctl iogpu.wired_limit_mb=20000
 
attention c'est agressif, ça va te laisser 4GB pour le système. J'espère que tu as un autre ordinateur pour faire des trucs à côté ?  
 
Si il ne te laisse pas charger le modèle tu dois appuyer sur la touche option du clavier pour que le bouton redevienne cliquable (ça revient à debrayer la sécurité et serrer les fesses pour que ça ne parte pas en out of memory. Attention quand même ^^)

Message cité 2 fois
Message édité par neo world le 02-09-2026 à 00:07:04
n°47201
neo world
Posté le 02-09-2026 à 00:31:44  profilanswer
 

p'tit dashboard bien pratique qui récupère les stats llamacpp ( / metrics ) et ceux de rocm-smi pour surveiller ce que fait mon modèle / les agents :
https://rehost.diberie.com/Picture/Get/f/540578
 
Ca permet de pleurer un peu sur la faible memory usage avec ce qwen 3.8 flash next optimisé : https://atomic.chat/blog/guides/how [...] xt-locally
J'espère qu'ils trouveront un moyen de mettre en place le RoPE/YaRN pour monter le contexte à 1M. J'ai essayé en mode brutasse et llama reserve plus de mémoire sans laisser utiliser plus de 260k tokens :D

n°47202
b-tzu
Geek a toute heure...
Posté le 02-09-2026 à 00:45:42  profilanswer
 

neo world a écrit :

quel quantisation pour le modèle ? Tu as le qwen3.8 27b 4 bit MLX qui pèse 16Go. ça passe :D
De base ton gpu est limité à 75% de ta RAM faut lui passer
sudo sysctl iogpu.wired_limit_mb=20000
 
attention c'est agressif, ça va te laisser 4GB pour le système. J'espère que tu as un autre ordinateur pour faire des trucs à côté ?  
 
Si il ne te laisse pas charger le modèle tu dois appuyer sur la touche option du clavier pour que le bouton redevienne cliquable (ça revient à debrayer la sécurité et serrer les fesses pour que ça ne parte pas en out of memory. Attention quand même ^^)


 
qwen3.8 27b 4 bit MLX qui pèse 16Go. => jai pas vu le mot 4B sur LM studio (ils le cachent qq part) mais oui, cest ce que j'ai, avec les 16Go. jai voulu tester vite fait ca passait pas. je fais du dev avec claude cloud a coté, donc a partir du moment ou je peux avoir un onglet chrome/claude desktop ouvert ca me suffit. je vais tester ton parametre de ram.  
tu lui laisse combien de contexte avec ca ?


---------------
Topic Ventes || Topic Jeux Vidéos || Topic Téléphonie (Rien pour le moment)
n°47203
neo world
Posté le 02-09-2026 à 00:48:54  profilanswer
 

d'après la reglette magique lm studio : 12k. Au dessus tu arrives à plus de 20GO en RAM

n°47207
AllenMadis​on
Oracle du Keb's
Posté le 02-09-2026 à 07:39:10  profilanswer
 

Au rang des cartes qui vont interesser tout le monde :

 

https://hardwareand.co/actualites/l [...] w-pour-lia

 

Intel Crescent Island, jusqu'à 480go de ram sur une carte :D

 

Spécialement dédiée à l'IA, pas de raytracing, 350w

 

https://i.imgur.com/Hb9gz9s.png

 

Un petit setup avec 2 cartes je dirais pas non :o

 

ça va être sympa l'année prochaine, entre ces cartes, la xiaomi AI box etc

Message cité 2 fois
Message édité par AllenMadison le 02-09-2026 à 07:49:21

---------------
Nothing much to teach, man. There's ze high, there's ze low and yall still fucking miss.
n°47208
FlorentG
Posté le 02-09-2026 à 07:57:56  profilanswer
 

AllenMadison a écrit :

Intel Crescent Island, jusqu'à 480go de ram sur une carte :D


C'te virage que ça a pris [:petrus75]

n°47211
AllenMadis​on
Oracle du Keb's
Posté le 02-09-2026 à 08:15:37  profilanswer
 

FlorentG a écrit :


C'te virage que ça a pris [:petrus75]

 

Honnetement Intel est pas con sur le coup, plutot que de faire des cartes de jeu et concurrencer nvidia (chose impossible), faire des cartes AI pour l'avoir en local ils peuvent se faire des couilles en or. Si c'est bien pricé et qu'ils font eux meme la ram dans leur usines de gravure, ça peut être intéressant. Il faudra voir s'ils ont sur la carte des trucs équivalent a ce que xiaomi prévoit sur sa box avec des chip qui accélèrent l'inférence et le prefill
S'ils vendent les 480gb au meme prix que les 96gb de blackwell pro le match sera plié.

Message cité 1 fois
Message édité par AllenMadison le 02-09-2026 à 08:21:28

---------------
Nothing much to teach, man. There's ze high, there's ze low and yall still fucking miss.
n°47215
the_fennec
f3nn3cUs z3rd4
Posté le 02-09-2026 à 08:43:44  profilanswer
 

neo world a écrit :

p'tit dashboard bien pratique qui récupère les stats llamacpp ( / metrics ) et ceux de rocm-smi pour surveiller ce que fait mon modèle / les agents :
https://rehost.diberie.com/Picture/Get/f/540578
 
Ca permet de pleurer un peu sur la faible memory usage avec ce qwen 3.8 flash next optimisé : https://atomic.chat/blog/guides/how [...] xt-locally
J'espère qu'ils trouveront un moyen de mettre en place le RoPE/YaRN pour monter le contexte à 1M. J'ai essayé en mode brutasse et llama reserve plus de mémoire sans laisser utiliser plus de 260k tokens :D


 
En fait c'est un peu des menteurs AtomicChat o:

Citation :

the unsloth builds keep the n-gram table inside the weight shards, so the whole file has to sit in memory, while ours page the table from SSD, and the 92.9 GB build needs 54.5 GB of fast memory.


 
Sachant que c'est les gars d'Unsloth qui font les PRs de llama.cpp pour offload les ngrams sur disque. En plus leur IQ4_XS est un IQ1_M en réalité, voir ça au chargement de llama.cpp: file type   = IQ1_M - 1.75 bpw

Citation :


AD-3.84bpw-IQ4_XS-M64 84.9 GB 0.2277
UD-IQ1_M 74.5 GB 0.2217


 
Le KLD est meilleure sur le UD-IQ1_M d'Unsloth!


---------------
Faudra que je teste un jour :o
n°47217
b-tzu
Geek a toute heure...
Posté le 02-09-2026 à 08:47:48  profilanswer
 

neo world a écrit :

quel quantisation pour le modèle ? Tu as le qwen3.8 27b 4 bit MLX qui pèse 16Go. ça passe :D
De base ton gpu est limité à 75% de ta RAM faut lui passer
sudo sysctl iogpu.wired_limit_mb=20000
 
attention c'est agressif, ça va te laisser 4GB pour le système. J'espère que tu as un autre ordinateur pour faire des trucs à côté ?  
 
Si il ne te laisse pas charger le modèle tu dois appuyer sur la touche option du clavier pour que le bouton redevienne cliquable (ça revient à debrayer la sécurité et serrer les fesses pour que ça ne parte pas en out of memory. Attention quand même ^^)


j'ai lancé ta commande ça ma répondu : iogpu.wired_limit_mb: 0 -> 20000
Jai mis le contexte a 4K pour être sur
Et quand je lance un prompt :
 
Error
The selected model could not be loaded because your machine does not have enough available memory.
 
Try one of the following:
• Reduce load on your machine (close apps you're not using) and try again.
• Choose a smaller model or adjust model loading guardrails in Local Model Defaults.


---------------
Topic Ventes || Topic Jeux Vidéos || Topic Téléphonie (Rien pour le moment)
n°47221
the_fennec
f3nn3cUs z3rd4
Posté le 02-09-2026 à 09:00:35  profilanswer
 

AllenMadison a écrit :

Au rang des cartes qui vont interesser tout le monde :  
 
https://hardwareand.co/actualites/l [...] w-pour-lia
 
Intel Crescent Island, jusqu'à 480go de ram sur une carte :D
 
Spécialement dédiée à l'IA, pas de raytracing, 350w
 
https://i.imgur.com/Hb9gz9s.png
 
Un petit setup avec 2 cartes je dirais pas non :o
 
ça va être sympa l'année prochaine, entre ces cartes, la xiaomi AI box etc


 

AllenMadison a écrit :


 
Honnetement Intel est pas con sur le coup, plutot que de faire des cartes de jeu et concurrencer nvidia (chose impossible), faire des cartes AI pour l'avoir en local ils peuvent se faire des couilles en or. Si c'est bien pricé et qu'ils font eux meme la ram dans leur usines de gravure, ça peut être intéressant. Il faudra voir s'ils ont sur la carte des trucs équivalent a ce que xiaomi prévoit sur sa box avec des chip qui accélèrent l'inférence et le prefill  
S'ils vendent les 480gb au meme prix que les 96gb de blackwell pro le match sera plié.


 
Mouaif pas convaincu, 480GB de VRAM c'est bien, mais c'est de la DDR5. Si tu charges un gros modèle tu auras un prefill de merde vu la BP. Et avec 350W seulement, il doit pas y avoir des tonnes d'unité de calcul, le tg/s sera famélique. Niveau soft, Intel est un peu a la ramasse comparé a NV ou AMD. Faut pas s'étonner de plus trouver de DDR5 si les industriels sortent des cartes alacon comme ça.
 
Vu que NV laisse tomber le marché gamer et que les cartes Intel sont plutôt très bonnes pour le prix, Intel devrait pas laisser tomber au contraire.
 
Bon on verra bien une fois les bench et les prix sortis, mais elle ne fera pas d'ombre au Blackwells sur leur terrain.
 
Pour la box Xiaomi, si le prix est bon, ils ont moyen de frapper fort par contre. Mais il y a pas mal d'inconnues, le plus gênant c'est que c'est un SoC custom ARM donc le support pourrait être plus compliqué que du x86 ou on fait tourner ce qu'on veut. Coté GPU pareil, c'est pas dis que ça soit de tout repos. J'imagine que ça va se vendre comme des petit pains, il faudra commander et parier sur le support long terme de la bête.
[:ticento:5]

Message cité 2 fois
Message édité par the_fennec le 02-09-2026 à 09:01:56

---------------
Faudra que je teste un jour :o
n°47223
AllenMadis​on
Oracle du Keb's
Posté le 02-09-2026 à 09:22:08  profilanswer
 

the_fennec a écrit :

 

Mouaif pas convaincu, 480GB de VRAM c'est bien, mais c'est de la DDR5. Si tu charges un gros modèle tu auras un prefill de merde vu la BP. Et avec 350W seulement, il doit pas y avoir des tonnes d'unité de calcul, le tg/s sera famélique. Niveau soft, Intel est un peu a la ramasse comparé a NV ou AMD. Faut pas s'étonner de plus trouver de DDR5 si les industriels sortent des cartes alacon comme ça.

 

Vu que NV laisse tomber le marché gamer et que les cartes Intel sont plutôt très bonnes pour le prix, Intel devrait pas laisser tomber au contraire.

 

Bon on verra bien une fois les bench et les prix sortis, mais elle ne fera pas d'ombre au Blackwells sur leur terrain.

 

Pour la box Xiaomi, si le prix est bon, ils ont moyen de frapper fort par contre. Mais il y a pas mal d'inconnues, le plus gênant c'est que c'est un SoC custom ARM donc le support pourrait être plus compliqué que du x86 ou on fait tourner ce qu'on veut. Coté GPU pareil, c'est pas dis que ça soit de tout repos. J'imagine que ça va se vendre comme des petit pains, il faudra commander et parier sur le support long terme de la bête.
[:ticento:5]

 

Rien ne t'empeche d'en prendre une pour la ram et à côté mettre une blackwell pro :o

 

Faudra voir les benchs, mais mettre 480go de ram si c'est pour avoir du compute riquiqui c'est pas forcément judicieux oui

Message cité 1 fois
Message édité par AllenMadison le 02-09-2026 à 09:23:06

---------------
Nothing much to teach, man. There's ze high, there's ze low and yall still fucking miss.
n°47224
neo world
Posté le 02-09-2026 à 09:33:57  profilanswer
 

the_fennec a écrit :


 
En fait c'est un peu des menteurs AtomicChat o:

Citation :

the unsloth builds keep the n-gram table inside the weight shards, so the whole file has to sit in memory, while ours page the table from SSD, and the 92.9 GB build needs 54.5 GB of fast memory.


 
Sachant que c'est les gars d'Unsloth qui font les PRs de llama.cpp pour offload les ngrams sur disque. En plus leur IQ4_XS est un IQ1_M en réalité, voir ça au chargement de llama.cpp: file type   = IQ1_M - 1.75 bpw

Citation :


AD-3.84bpw-IQ4_XS-M64 84.9 GB 0.2277
UD-IQ1_M 74.5 GB 0.2217


 
Le KLD est meilleure sur le UD-IQ1_M d'Unsloth!


C’est plus complique Que ça encore : y’a un bout en un , un autre en deux et encore un autre en 4 ou 5 selon la mémoire disponible. Pour l’instant j’ai pas décelé de problème de qualité et c’est carrément plus rapide qu’en 4 « consistant » :jap:
 
Si Qwen 4 suit la même tendance on va pouvoir faire beaucoup plus avec notre matos actuel. Ce sera quand même rapidement désuet mais on aura plusieurs classes de modèles avec lesquels on pourra jouer :D

n°47225
neo world
Posté le 02-09-2026 à 09:36:00  profilanswer
 

b-tzu a écrit :


j'ai lancé ta commande ça ma répondu : iogpu.wired_limit_mb: 0 -> 20000
Jai mis le contexte a 4K pour être sur
Et quand je lance un prompt :
 
Error
The selected model could not be loaded because your machine does not have enough available memory.
 
Try one of the following:
• Reduce load on your machine (close apps you're not using) and try again.
• Choose a smaller model or adjust model loading guardrails in Local Model Defaults.


Faut que tu fermes tout avant et éventuellement relancer ton navigateur avec un tab à côté. Mais si tu gardes Claude code je pense sue c’est mort pour consommer moins de 4go :jap:

n°47226
speedboyz3​0
Guide Michelin :o
Posté le 02-09-2026 à 09:36:43  profilanswer
 

neo world a écrit :

d'après la reglette magique lm studio : 12k. Au dessus tu arrives à plus de 20GO en RAM


 
12k de contexte, autant dire inutile non ? :o
A part dire, ça rentre  [:sid sidious:1]

n°47227
neo world
Posté le 02-09-2026 à 09:37:47  profilanswer
 

the_fennec a écrit :


 
Mouaif pas convaincu, 480GB de VRAM c'est bien, mais c'est de la DDR5. Si tu charges un gros modèle tu auras un prefill de merde vu la BP. Et avec 350W seulement, il doit pas y avoir des tonnes d'unité de calcul, le tg/s sera famélique. Niveau soft, Intel est un peu a la ramasse comparé a NV ou AMD. Faut pas s'étonner de plus trouver de DDR5 si les industriels sortent des cartes alacon comme ça.
 
Vu que NV laisse tomber le marché gamer et que les cartes Intel sont plutôt très bonnes pour le prix, Intel devrait pas laisser tomber au contraire.
 
Bon on verra bien une fois les bench et les prix sortis, mais elle ne fera pas d'ombre au Blackwells sur leur terrain.
 
Pour la box Xiaomi, si le prix est bon, ils ont moyen de frapper fort par contre. Mais il y a pas mal d'inconnues, le plus gênant c'est que c'est un SoC custom ARM donc le support pourrait être plus compliqué que du x86 ou on fait tourner ce qu'on veut. Coté GPU pareil, c'est pas dis que ça soit de tout repos. J'imagine que ça va se vendre comme des petit pains, il faudra commander et parier sur le support long terme de la bête.
[:ticento:5]


Le chip AMD strix halo consomme… 80watts au travail. 350 watts y’a moyen d’en faire une (mini) fusée en comparaison :D

n°47228
neo world
Posté le 02-09-2026 à 09:39:11  profilanswer
 

speedboyz30 a écrit :


 
12k de contexte, autant dire inutile non ? :o
A part dire, ça rentre  [:sid sidious:1]


C’est pas pour rien que je te dis d’en prendre plus. Mais 12k c’est pas inutile non plus si tu bosses sur des morceaux de projet bien compartimentés :D

n°47230
epsiloncen​taury
Posté le 02-09-2026 à 09:56:25  profilanswer
 

Dilemme avec ma RAM. Il y a 3 ans, je voulais commander 2x16 Go. Je me suis trompé, j'ai reçu une barrette de 32 Go. Sur le moment, je me suis dit que ce n'était pas grave. Aujourd'hui, je me rends compte que c'est une erreur. Le single channel, c'est une catastrophe pour la bande passante. Je perds 50% par rapport à du dual channel. 25,6 Go/s en moins, c'est énorme pour IA en offloading  sur le CPU.

 

Je me suis dit que j'allais racheter une barrette de 32 Go pour faire du dual channel. Mais aux prix actuels, c'est mort.  :D

 

Du coup, j'ai pensé à une autre solution. Utiliser des barrettes qui dorment dans un tiroir. J'ai 2x8 Go en 2400 et 2x8 Go en 3200 SODIMM. Avec des adaptateurs, je peux les mettre sur la carte mère et avoir 32 Go en dual channel.

 

Bande passante estimée 46,4 Go/s au lieu de 25,6 Go/s, si je les pousse a 2900.  C'est un vrai gain, et je pourrais vendre ma barrette de 32Go

 

Qu'est-ce que vous en pensez ?.

Message cité 1 fois
Message édité par epsiloncentaury le 02-09-2026 à 09:57:09
n°47232
the_fennec
f3nn3cUs z3rd4
Posté le 02-09-2026 à 10:05:27  profilanswer
 

AllenMadison a écrit :


 
Rien ne t'empeche d'en prendre une pour la ram et à côté mettre une blackwell pro :o
 
Faudra voir les benchs, mais mettre 480go de ram si c'est pour avoir du compute riquiqui c'est pas forcément judicieux oui


 
Ya au moins pour 8000 balles de RAM sur la carte, donc ça sent le 10k grand minimum pour la carte, je serais pas surpris que ça soit le double a la sortie...
Je vois pas trop qui mettrait autant dans une carte au support en carton :o


---------------
Faudra que je teste un jour :o
n°47235
the_fennec
f3nn3cUs z3rd4
Posté le 02-09-2026 à 10:14:55  profilanswer
 

neo world a écrit :


C’est plus complique Que ça encore : y’a un bout en un , un autre en deux et encore un autre en 4 ou 5 selon la mémoire disponible. Pour l’instant j’ai pas décelé de problème de qualité et c’est carrément plus rapide qu’en 4 « consistant » :jap:


Oui, c'est le principe des quants dynamiques, c'est d'ailleurs pour ça le AD dans le nom, comme les UD. Mais la les ngrams sont en Q8 et les actifs en Q1 ou Q2, ça fait peut être une moyenne en Q4, mais c'est pas vraiment honnête. De mon coté il est quand même bien partis en couille après 24h de compute. Après les séries de "Oh wait", il a fini par juste afficher /////////// et claude-code a fini par agir a ma grande surprise. Il a coupé le thinking en lui disant qu'il était partis en boucle! Si ça se trouve il l'avait déjà fait avant. Je pense tester le UD en Q4 avec plus de layers en CPU pour voir.
 
La je suis repassé sur 27B pour le moment.
 

neo world a écrit :


Si Qwen 4 suit la même tendance on va pouvoir faire beaucoup plus avec notre matos actuel. Ce sera quand même rapidement désuet mais on aura plusieurs classes de modèles avec lesquels on pourra jouer :D


 
Quand le prochain successeur du 35B va sortir ça va être une tuerie, limite on peut garder les ngrams tel quels :love:  
 
 

neo world a écrit :

Le chip AMD strix halo consomme… 80watts au travail. 350 watts y’a moyen d’en faire une (mini) fusée en comparaison :D


 
Reste a espérer que c'est pas juste Intel qui est moins efficace qu'AMD... ça serait pas la première fois :o


---------------
Faudra que je teste un jour :o
n°47237
the_fennec
f3nn3cUs z3rd4
Posté le 02-09-2026 à 10:21:31  profilanswer
 

epsiloncentaury a écrit :

Dilemme avec ma RAM. Il y a 3 ans, je voulais commander 2x16 Go. Je me suis trompé, j'ai reçu une barrette de 32 Go. Sur le moment, je me suis dit que ce n'était pas grave. Aujourd'hui, je me rends compte que c'est une erreur. Le single channel, c'est une catastrophe pour la bande passante. Je perds 50% par rapport à du dual channel. 25,6 Go/s en moins, c'est énorme pour IA en offloading  sur le CPU.  
 
Je me suis dit que j'allais racheter une barrette de 32 Go pour faire du dual channel. Mais aux prix actuels, c'est mort.  :D  
 
Du coup, j'ai pensé à une autre solution. Utiliser des barrettes qui dorment dans un tiroir. J'ai 2x8 Go en 2400 et 2x8 Go en 3200 SODIMM. Avec des adaptateurs, je peux les mettre sur la carte mère et avoir 32 Go en dual channel.
 
Bande passante estimée 46,4 Go/s au lieu de 25,6 Go/s, si je les pousse a 2900.  C'est un vrai gain, et je pourrais vendre ma barrette de 32Go
 
Qu'est-ce que vous en pensez ?.


 
Est-ce que ça change beaucoup la BP RAM pour de l'inférence? C'est pas plutôt le CPU qui est limitant?
Il me semble que llama.cpp a du LRU pour le MoE dans les plans, ça minimiserait un peu le besoin en BP.
 
A ta place je testerais avec le matos que tu as déjà, fais un bench MoE avec 32GB, puis le même avec tes 2x8 Go en 2400 pour voir. Tu peux même tester un dense pour voir le pire cas.
 
Ensuite, si ya pas de diff, tu mets 32GB + 2*8GB et t'as 48GB gratos :D


---------------
Faudra que je teste un jour :o
n°47239
Quich
Pouet ?
Posté le 02-09-2026 à 10:32:59  profilanswer
 

the_fennec a écrit :

 

Ya au moins pour 8000 balles de RAM sur la carte, donc ça sent le 10k grand minimum pour la carte, je serais pas surpris que ça soit le double a la sortie...
Je vois pas trop qui mettrait autant dans une carte au support en carton :o


Y'a écrit Intel :o

 

Une des questions c'est la bande passante de la mémoire embarquée, un commentaire ici estime 1,3TB/s :

Citation :

Assuming 24GB per LPDDR5X package, 20 packages of 8533MT/s @ 64-bit gives ~1.3TB/s bandwidth.


Citation :

The AMD Instinct MI350P is like 3.6-4TB/s, and the NVIDIA RTX Pro 6000 Blackwell is 1.6-1.79TB/s

Message cité 1 fois
Message édité par Quich le 02-09-2026 à 10:33:32

---------------
Feedback
n°47243
the_fennec
f3nn3cUs z3rd4
Posté le 02-09-2026 à 10:57:53  profilanswer
 

Quich a écrit :


Y'a écrit Intel :o
 
Une des questions c'est la bande passante de la mémoire embarquée, un commentaire ici estime 1,3TB/s :

Citation :

Assuming 24GB per LPDDR5X package, 20 packages of 8533MT/s @ 64-bit gives ~1.3TB/s bandwidth.


Citation :

The AMD Instinct MI350P is like 3.6-4TB/s, and the NVIDIA RTX Pro 6000 Blackwell is 1.6-1.79TB/s



 
C'est pas mal en chiffre brut, mais il faut mettre ça en rapport avec le compute. Les cartes AMD et NV sont a 600W, il est peu probable qu'Intel soit aussi efficace, mais admettons qu'elle soit juste que 2x plus lente avec ses 350W. AMD a 144GB et NV 96GB, le rapport compute/VRAM est complètement déséquilibré, on a 2x moins de compute pour 4/5x plus de RAM.
 
Si l'archi de Qwen4 se démocratise avec ses ngrams sur SSD ou même RAM, cette carte en version 480GB sera pas pertinente. Après ça doit pas coûter grand-chose a Intel d'ajouter plus ou moins de RAM. Une carte dans les 100GB a bon prix pourrait être intéressante.


---------------
Faudra que je teste un jour :o
n°47245
speedboyz3​0
Guide Michelin :o
Posté le 02-09-2026 à 11:27:16  profilanswer
 

Bon, Fable 5.1 vient de me convaincre d'abandonner le M3 Ultra :
 

Citation :


Agentic work is prefill-heavy, and prefill is compute-bound — where M3 Ultra is weakest. Every agent turn re-ingests the new tool output on top of the existing context. Prefill runs on GPU matmul throughput, not bandwidth, and the M5 GPU's Neural Accelerators are exactly that. Apple claims 4.3x peak AI compute for M5 Ultra over M3 Ultra; the M5 Max is roughly half an Ultra, so figure ~2x the M3 Ultra on prefill — a rough estimate, not a measurement.
 
Illustrative agent turn: 60K tokens to prefill, 800 tokens to generate, 27B model.
 
M3 Ultra: ~100 s prefill + ~29 s decode ≈ 130 s
M5 Max: ~50 s prefill + ~38 s decode ≈ 90 s


 
C'est énorme comme différence  [:moonbloood:2]

n°47248
b-tzu
Geek a toute heure...
Posté le 02-09-2026 à 11:45:28  profilanswer
 

Si quelqu’un veut un Mac mini M1 Pro avec 32Go de ram pour 650€ :  
 
Voici une annonce intéressante que je viens de trouver sur leboncoin : https://www.leboncoin.fr/ad/ordinateurs/3261452115


---------------
Topic Ventes || Topic Jeux Vidéos || Topic Téléphonie (Rien pour le moment)
n°47249
neo world
Posté le 02-09-2026 à 11:50:27  profilanswer
 

speedboyz30 a écrit :

Bon, Fable 5.1 vient de me convaincre d'abandonner le M3 Ultra :
 

Citation :


Agentic work is prefill-heavy, and prefill is compute-bound — where M3 Ultra is weakest. Every agent turn re-ingests the new tool output on top of the existing context. Prefill runs on GPU matmul throughput, not bandwidth, and the M5 GPU's Neural Accelerators are exactly that. Apple claims 4.3x peak AI compute for M5 Ultra over M3 Ultra; the M5 Max is roughly half an Ultra, so figure ~2x the M3 Ultra on prefill — a rough estimate, not a measurement.
 
Illustrative agent turn: 60K tokens to prefill, 800 tokens to generate, 27B model.
 
M3 Ultra: ~100 s prefill + ~29 s decode ≈ 130 s
M5 Max: ~50 s prefill + ~38 s decode ≈ 90 s


 
C'est énorme comme différence  [:moonbloood:2]


Je ne regrette pas mon Strix halo. Ca devrait aller avec un m3 ultra monstrueux.  
 
Pense aussi que tu feras d'autres trucs à côté avec ton mac studio (pi / hermes / open claw (par ordre de douleur pour ton studio) 30GB de plus c'est quand même mieux. Après si tu peux avoir un M5 ultra avec 96GB de RAM ...  :love:

n°47250
the_fennec
f3nn3cUs z3rd4
Posté le 02-09-2026 à 11:53:42  profilanswer
 

2/5 of my CMP 170HX have died after 2 weeks and the 3rd came with defective tensor cores. Current prices DO NOT justify the risk you are taking
https://www.reddit.com/r/LocalLLaMA [...] weeks_and/
 
Donc a $200 ça valait le coup, mais pas plus. Au final c'est logique que NV ait fait un minimum de tests poussés sur des chips aussi chères avant de les biner. Sur les BC250 j'imagine que ce sont des batchs entiers qui ont du partir si un pourcentage donné passait pas les tests.


---------------
Faudra que je teste un jour :o
n°47251
neo world
Posté le 02-09-2026 à 11:54:12  profilanswer
 

Sinon déménagement sur Strix halo fait : le NAS et en particulier les disques ont juste perdu 8°. Le Strix halo a perdu 18°
 
Voilà hésitez pas à prendre un rack bunker IP65 et à y coller un chauffage l'été.  [:600000_voix:8]


Message édité par neo world le 02-09-2026 à 11:57:19
n°47252
neo world
Posté le 02-09-2026 à 11:56:50  profilanswer
 

the_fennec a écrit :

2/5 of my CMP 170HX have died after 2 weeks and the 3rd came with defective tensor cores. Current prices DO NOT justify the risk you are taking
https://www.reddit.com/r/LocalLLaMA [...] weeks_and/
 
Donc a $200 ça valait le coup, mais pas plus. Au final c'est logique que NV ait fait un minimum de tests poussés sur des chips aussi chères avant de les biner. Sur les BC250 j'imagine que ce sont des batchs entiers qui ont du partir si un pourcentage donné passait pas les tests.


Surtout Sony a vu le bordel des X360 qui mourraient en pagaille et le coût de leur rapatriement. Nvidia peut toujours dire que la carte a été usée trop vite pas un usage soutenu H24. La PS5 doit tourner 5 ans dans le salon d'un fumeur qui élève des moutons de poussière en seconde activité :o

n°47255
the_fennec
f3nn3cUs z3rd4
Posté le 02-09-2026 à 12:08:03  profilanswer
 

neo world a écrit :


Surtout Sony a vu le bordel des X360 qui mourraient en pagaille et le coût de leur rapatriement. Nvidia peut toujours dire que la carte a été usée trop vite pas un usage soutenu H24. La PS5 doit tourner 5 ans dans le salon d'un fumeur qui élève des moutons de poussière en seconde activité :o


 
Sans parler de l'image de marque :lol:
 
NVidia s'en cogne des cartes CMP/BC250 qui lâchent, surtout des années après leur vente. Elle doivent avoir 90 voir 30 jours de SAV pour les CMP, si c'est NV qui les fait, les BC c'est ASRock donc le SAV doit être plus court encore.
 
Sur ebay les CMP 170HX sont a plus de $2000 avec unlock, donc si tu peux en chopper une moins chère sans unlock tu peux être sur qu'elle a un soucis.


---------------
Faudra que je teste un jour :o
n°47256
speedboyz3​0
Guide Michelin :o
Posté le 02-09-2026 à 12:24:17  profilanswer
 

neo world a écrit :


Je ne regrette pas mon Strix halo. Ca devrait aller avec un m3 ultra monstrueux.

 

Pense aussi que tu feras d'autres trucs à côté avec ton mac studio (pi / hermes / open claw (par ordre de douleur pour ton studio) 30GB de plus c'est quand même mieux. Après si tu peux avoir un M5 ultra avec 96GB de RAM ...  :love:

 

Bon, Claude me dirige de plus en plus vers ça :

 

Mini PC Asus Ascent GX10 GB10 128GB 1TB SSD NVIDIA Blackwell WiFi 7
Mini PC Lenovo ThinkStation PGX NVIDIA GB10 128GB 1TB SSD Blackwell DGX OS Wi-Fi 7

 

Edit: mes liens sont morts, les prix plus dispos :/

 

Il me dit à juste titre que le gap de prix ne vaut pas le coup.
Ce qu'on gagne en bande passante RAM sur le Mac, on le perd en prefill time et en multiple threads.
Au final c'est kiffe kiffe. Voire mieux pour mon usage (plusieurs agents).

 

Et on gagne Cuda  [:la chancla:1]  

 

Et surtout on gagne 1400 euros :o

Spoiler :


De quoi upgrade mon macbook air M3 24Go vers un Pro :o
 [:la chancla:1]

Message cité 1 fois
Message édité par speedboyz30 le 02-09-2026 à 19:49:55
n°47257
neo world
Posté le 02-09-2026 à 12:37:50  profilanswer
 

speedboyz30 a écrit :


 
Bon, Claude me dirige de plus en plus vers ça :
 
Mini PC Asus Ascent GX10 GB10 128GB 1TB SSD NVIDIA Blackwell WiFi 7  
4200 euros
https://www.pccomponentes.fr/mini-p [...] os-wi-fi-7
 
Mini PC Lenovo ThinkStation PGX NVIDIA GB10 128GB 1TB SSD Blackwell DGX OS Wi-Fi 7  
4300 euros
https://www.pccomponentes.com/mini- [...] os-wi-fi-7
 
Il me dit à juste titre que le gap de prix ne vaut pas le coup.
Ce qu'on gagne en bande passante RAM sur le Mac, on le perd en prefill time et en multiple threads.
Au final c'est kiffe kiffe. Voire mieux pour mon usage (plusieurs agents).
 
Et on gagne Cuda  [:la chancla:1]  
 
Et surtout on gagne 1400 euros :o

Spoiler :


De quoi upgrade mon macbook air M3 24Go vers un Pro :o
 [:la chancla:1]



C'est pas ce que je ferai en premier choix mais je pense que c'est viable :jap:

n°47258
neo world
Posté le 02-09-2026 à 12:48:54  profilanswer
 

Je test un nouveau workflow ici :
J'écris mon cahier des charges un peu brut à Claude pour qu'il me le rephrase au propre puis je corrige une dernière fois pour que ce soit comme je le souhaite
J'enregistre tout ce qui est token et infos sensibles dans un secret-tool (ça évite les 15 allers retours inutiles sur le fait qu'il ne sait pas où stocker le bordel proprement et qu'un fichier pourrait fonctionner mais oups le chmod 600 encore et encore :pt1cable: )
je lance sur pi dev  
 
j'attends  [:toyoyost:3]  
 
Sinon j'aime bien pi dev. Clairement brut de décoffrage mais comme il me recopie tout ce qu'ils se passe derrière je comprend là où le modèle perd du temps pour corriger et ça fait un vrai potentiel gain pour la communauté (moins de plugins qui existent qu'avec les autres harness mais qui pourraient être utiles à moi et la communauté si j'arrive à sortir des trucs propres)


Message édité par neo world le 02-09-2026 à 12:51:27
 Page :   1  2  3  4  5  ..  53  54  55  ..  57  58  59  60  61  62

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)