Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
3307 connectés 

 


Je génère ...
Sondage à 3 choix possibles.
Ce sondage expirera le 20-09-2026 à 10:00




Attention si vous cliquez sur "voir les résultats" vous ne pourrez plus voter

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  54  55  56  57  58  59
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°47258
neo world
Posté le 02-09-2026 à 12:48:54  profilanswer
 

Reprise du message précédent :
Je test un nouveau workflow ici :
J'écris mon cahier des charges un peu brut à Claude pour qu'il me le rephrase au propre puis je corrige une dernière fois pour que ce soit comme je le souhaite
J'enregistre tout ce qui est token et infos sensibles dans un secret-tool (ça évite les 15 allers retours inutiles sur le fait qu'il ne sait pas où stocker le bordel proprement et qu'un fichier pourrait fonctionner mais oups le chmod 600 encore et encore :pt1cable: )
je lance sur pi dev  
 
j'attends  [:toyoyost:3]  
 
Sinon j'aime bien pi dev. Clairement brut de décoffrage mais comme il me recopie tout ce qu'ils se passe derrière je comprend là où le modèle perd du temps pour corriger et ça fait un vrai potentiel gain pour la communauté (moins de plugins qui existent qu'avec les autres harness mais qui pourraient être utiles à moi et la communauté si j'arrive à sortir des trucs propres)


Message édité par neo world le 02-09-2026 à 12:51:27
n°47259
epsiloncen​taury
Posté le 02-09-2026 à 12:50:13  profilanswer
 

the_fennec a écrit :


 
Est-ce que ça change beaucoup la BP RAM pour de l'inférence? C'est pas plutôt le CPU qui est limitant?
Il me semble que llama.cpp a du LRU pour le MoE dans les plans, ça minimiserait un peu le besoin en BP.
 
A ta place je testerais avec le matos que tu as déjà, fais un bench MoE avec 32GB, puis le même avec tes 2x8 Go en 2400 pour voir. Tu peux même tester un dense pour voir le pire cas.
 
Ensuite, si ya pas de diff, tu mets 32GB + 2*8GB et t'as 48GB gratos :D


 
je sais pas  j'ai pas testé.  J'ai testé 48mo avec les 2x8go a 2900 (donc en dual) , j'ai pas vraiment vu de différence.
 
Il voir avec les adaptateurs Sodimm.
 
Mon cpu est un Ryzen 7 5700G .  

n°47260
speedboyz3​0
Guide Michelin :o
Posté le 02-09-2026 à 12:51:45  profilanswer
 

neo world a écrit :


C'est pas ce que je ferai en premier choix mais je pense que c'est viable :jap:


 
Si ça peut servir de réflexion à d'autres :  
 
/!\ Alerte IA /!\
 
 
Serveur IA local pour agents (2 utilisateurs) : Mac Studio M5 Max / M5 Ultra vs box GB10 (DGX Spark)
 
Prix constatés le 02/09/2026, TTC, config 128 Go ou 96 Go / 1 To.
 


                       M5 Max 128 Go     M5 Ultra 96 Go    GB10 / DGX Spark
                       (Mac Studio)      (Mac Studio)      (Lenovo PGX / ASUS GX10)
--------------------------------------------------------------------------------
Prix                   5 660 €           6 170 €           4 169 € (Lenovo, PcComponentes)
                                                           4 639 € (ASUS, PcComponentes.fr)
Mémoire unifiée        128 Go            96 Go             128 Go
Bande passante         614 Go/s          1,2 To/s          273 Go/s
GPU                    40c + Neural Acc. 64c + Neural Acc. Blackwell, ~1 PFLOP FP4
CPU                    18c               30c               20c ARM
OS                     macOS             macOS             DGX OS (Ubuntu 24.04 ARM64)
Stack d'inférence      MLX / llama.cpp   MLX / llama.cpp   vLLM / SGLang / TensorRT-LLM
Batching multi-agents  moyen             moyen             excellent (CUDA)
Cluster 2 boîtiers     TB5 RDMA (annoncé)TB5 RDMA (annoncé)ConnectX-7 -> 256 Go
Montage vidéo          oui (Media Eng.)  oui (Media Eng.)  non (pas de Resolve/Premiere ARM Linux)


 
Ordre de grandeur : un tour d'agent, 27B dense Q4, 60K tokens de prefill + 800 tokens générés, 1 seul flux
 


                  Prefill          Décodage        Total
M3 Ultra 96 Go    120-150 s        ~29 s (28 t/s)  150-180 s
M5 Max 128 Go     65-100 s         ~36 s (22 t/s)  100-135 s
GB10 (Spark)      40-70 s          ~67 s (12 t/s)  110-135 s
M5 Ultra 96 Go    35-50 s          ~19 s (42 t/s)  55-70 s


 
Source : la ligne GB10 est mesurée (Qwen3.8-27B, llama.cpp ~838 t/s prefill, ~11,5 t/s décodage ; vLLM NVFP4 fait mieux en batch). M5 Max = extrapolation depuis des benchs M5 Max MacBook Pro. M5 Ultra = pure extrapolation (2x M5 Max), personne n'a encore la machine. M3 Ultra = benchs communautaires llama.cpp.
 
Points clés pour un usage agentique
 
1. Deux métriques, pas une. Le prefill (ingestion du contexte) dépend du calcul GPU ; le décodage dépend de la bande passante mémoire. Les agents sont très lourds en prefill : à chaque étape ils réingèrent la sortie des outils, les fichiers, l'historique. La bande passante seule ne suffit pas.
 
2. Le M3 Ultra reconditionné est un piège pour ce cas. Ses 819 Go/s ne gagnent que ~7 s en décodage mais l'absence de Neural Accelerators lui fait perdre 50+ s en prefill par rapport au M5 Max. Excellent pour du chat, mauvais pour des agents.
 
3. Multi-agents = problème de débit agrégé, pas de latence. Sur GB10, vLLM NVFP4 monte à ~84 t/s agrégés à 10 requêtes simultanées contre ~12 t/s en flux unique : la concurrence est quasi gratuite. Sur Mac, le batching MLX est moins mature et chaque agent supplémentaire ampute visiblement les autres.
 
4. La mémoire fixe le plafond de modèle. La classe qui compte en 2026 pour les agents, c'est les MoE 100-125B (gpt-oss-120b ~60 Go, Qwen3.8 Flash-Next ~107 Go en Q4). Avec 96 Go, Flash-Next en Q4 ne rentre pas. Avec 128 Go, ça passe, mais 2 sessions longues sur Flash-Next restent tendues ; gpt-oss-120b est confortable. Passer le M5 Ultra à 256 Go coûte +4 000 $.
 
5. Dense vs MoE sur GB10. Le 273 Go/s fait mal sur un modèle dense (27B à 12 t/s, on le sent). Sur MoE 3-6B actifs (Qwen3-Coder-30B-A3B, Qwen3.x-35B-A3B, gpt-oss-120b) le Spark tourne à 45-90 t/s. Pour des agents, on tourne en MoE de toute façon.
 
6. Écart intelligence 27B dense vs MoE 125B (chiffres Qwen, non répliqués) : quasi nul en tâche isolée (SWE-bench Pro 62,5 vs 61,7), large sur les tâches longues et agentiques (DeepSWE 58,7 vs 42,2, JobBench 55,7 vs 33,4). Le 27B boucle ou perd le fil à l'étape 14 ; le 125B finit la tâche.
 
7. Le choix logiciel compte autant que la puce. Sur Mac, les gains des Neural Accelerators passent par MLX ; llama.cpp/Ollama en capturent moins. Sur GB10, viser vLLM ou SGLang en NVFP4 (natif Blackwell, +46 % de débit batché vs FP8), prefix caching activé pour que les agents partageant un system prompt ne re-prefillent pas.
 
Verdict : pour plusieurs agents + 2 utilisateurs, la box GB10 à ~4 200 € l'emporte (128 Go, batching CUDA, second boîtier possible pour 256 Go, moins cher qu'un seul M5 Ultra). Le M5 Max 128 Go reste le bon choix si on veut une machine unique qui fait aussi du montage vidéo et qu'on refuse un Linux ARM headless. Le M5 Ultra 96 Go est le plus rapide en flux unique mais bridé par ses 96 Go pour ce cas d'usage.

n°47268
neo world
Posté le 02-09-2026 à 13:49:37  profilanswer
 

speedboyz30 a écrit :


 
Si ça peut servir de réflexion à d'autres :  
 
/!\ Alerte IA /!\


dit donc j'espère que c'était généré localement sinon  [:johndoe1321:1] :o

n°47271
speedboyz3​0
Guide Michelin :o
Posté le 02-09-2026 à 14:05:53  profilanswer
 

neo world a écrit :


dit donc j'espère que c'était généré localement sinon  [:johndoe1321:1] :o


 
C'est du Fable 5.1  [:la chancla:5]  
 
Sur le fond tu penses toujours que le M5 Max 128Go est le meilleur parti ?

n°47272
the_fennec
f3nn3cUs z3rd4
Posté le 02-09-2026 à 14:08:59  profilanswer
 

epsiloncentaury a écrit :


 
je sais pas  j'ai pas testé.  J'ai testé 48mo avec les 2x8go a 2900 (donc en dual) , j'ai pas vraiment vu de différence.
 
Il voir avec les adaptateurs Sodimm.
 
Mon cpu est un Ryzen 7 5700G .  


 
Je pense que la BP est tellement faible par rapport a de la VRAM que 40 GB/s ou 20GB/s avec une poignée de core (vs un GPU) change pas grand-chose.


---------------
Faudra que je teste un jour :o
n°47273
neo world
Posté le 02-09-2026 à 14:21:27  profilanswer
 

speedboyz30 a écrit :


 
C'est du Fable 5.1  [:la chancla:5]  
 
Sur le fond tu penses toujours que le M5 Max 128Go est le meilleur parti ?


D'experience plus c'est facile à utiliser mieux c'est utilisé : il m'a fallu 30 minutes pour démarrer mon premier qwen et jouer avec avec lm studio quand j'ai reçu mon M5 pro et le lendemain j'avais ma stack de dev connectée dessus (vs code dev container, avec cline). Mon strix halo ça fait 5 mois qu'il prenait la poussière en attendant que je finisse "encore un p'tit truc" et j'ai encore des emmerdes à la con genre : comment remettre en état si je casse trop de trucs ? alors qu'avec le Mac j'ai time machine c'est super facile et rapide de revenir à la minute que je préfère
 
Je dis pas que le mac est supérieur en tout (notamment le rapport qualité prix qui n'est pas la spécialité de nvidia mais qui est érigé en anti-pattern chez Apple :o ) mais de mon expérience perso si tu veux être productif faut soit du très facile pour tester / utiliser au quotidien soit du très très rapide qui justifie de perdre plusieurs jours/semaines avant de trouver une stack bien et tellement rapide que ça ne sert à rien de chercher une alternative.
 
Perso je ne regrette pas mon strix halo : tous les "encore un p'tit truc" tenait du rêve de gosse quand j'ai commencé à installer des appliance de sécurité sur une vieille becane pour protéger mon réseau. Mais si je voulais être productif ben je mettais 3k€ de plus sur mon macbook pro et j'avais le macbook pro max 128GO et c'était marre j'avais mes agents le lendemain pour bosser :D

n°47276
b-tzu
Geek a toute heure...
Posté le 02-09-2026 à 14:58:54  profilanswer
 

neo world a écrit :


Faut que tu fermes tout avant et éventuellement relancer ton navigateur avec un tab à côté. Mais si tu gardes Claude code je pense sue c’est mort pour consommer moins de 4go :jap:


jai absolument tout fermé, meme erreur. Apres j'ai redemarré. MacOS a peine lancé, avec rien de lancé, c'est presque 7Go de ram utilisés. ca ne passera jamais avec ca du coup, impossible d'avoir 20Go dispo !  
Tu fais comment toi ?


---------------
Topic Ventes || Topic Jeux Vidéos || Topic Téléphonie (Rien pour le moment)
n°47277
neo world
Posté le 02-09-2026 à 15:01:14  profilanswer
 

J'ai 48GO ...  
 
Mais normalement ça devrait swapper en nvme (pas terrible pour la mémoire flash mais bref pas le choix) tu maintiens bien le bouton option du clavier quand tu clic sur le bouton "load model" ?

n°47279
b-tzu
Geek a toute heure...
Posté le 02-09-2026 à 15:06:20  profilanswer
 

Sur LM Studio ? je nai pas eu besoin, il se load bien, cest quand je poste un message qu'il m'affiche le message d'erreur.  
llama.cpp serait plus pratique a utiliser ? ca marche mieux ?


---------------
Topic Ventes || Topic Jeux Vidéos || Topic Téléphonie (Rien pour le moment)
n°47280
neo world
Posté le 02-09-2026 à 15:11:12  profilanswer
 

essaie de mettre un mini contexte (6k) et regarde ce que ça donne, copie colle les logs aussi (accessibles depuis l'icone developpeur en forme de prompt à gauche dans le menu principal)

n°47284
neo world
Posté le 02-09-2026 à 15:17:11  profilanswer
 

Ca vaut pas une vue mer / montagne / paysage semi urbain mais c'est sympa quand même  [:bakk6]  
 
https://rehost.diberie.com/Picture/Get/f/540705


Message édité par neo world le 02-09-2026 à 15:20:32
n°47287
the_fennec
f3nn3cUs z3rd4
Posté le 02-09-2026 à 15:42:14  profilanswer
 

C'est magnifique :love:
T'as tout ça avec l'API de llama.cpp ou tu choppes des trucs en plus?
 
Perso ça sera la map des layers en mémoire(s) que je voudrais. J'ai trouvé ça:
https://github.com/gpustack/gguf-parser-go
 
Mais Windows defender me dit qu'il y a un trojan dans les binaires alors j'ai pas insisté. Virustotal est presque green, donc je pense que c'est un faux positif, mais je testerais dans une semaine :o


---------------
Faudra que je teste un jour :o
n°47288
the_fennec
f3nn3cUs z3rd4
Posté le 02-09-2026 à 15:45:09  profilanswer
 

b-tzu a écrit :


jai absolument tout fermé, meme erreur. Apres j'ai redemarré. MacOS a peine lancé, avec rien de lancé, c'est presque 7Go de ram utilisés. ca ne passera jamais avec ca du coup, impossible d'avoir 20Go dispo !  
Tu fais comment toi ?


 

neo world a écrit :

J'ai 48GO ...  
 
Mais normalement ça devrait swapper en nvme (pas terrible pour la mémoire flash mais bref pas le choix) tu maintiens bien le bouton option du clavier quand tu clic sur le bouton "load model" ?


 
+1
peut être que tu n'as pas le mmap activé?
 

b-tzu a écrit :

Sur LM Studio ? je nai pas eu besoin, il se load bien, cest quand je poste un message qu'il m'affiche le message d'erreur.  
llama.cpp serait plus pratique a utiliser ? ca marche mieux ?


 
L'avantage de llama.cpp c'est que tu auras directement la ligne d'erreur, en plus ya pas de UI qui bouffe de la RAM inutilement.


---------------
Faudra que je teste un jour :o
n°47290
b-tzu
Geek a toute heure...
Posté le 02-09-2026 à 16:02:46  profilanswer
 

neo world a écrit :

essaie de mettre un mini contexte (6k) et regarde ce que ça donne, copie colle les logs aussi (accessibles depuis l'icone developpeur en forme de prompt à gauche dans le menu principal)


Contexte de 4K, logs vide  
[2026-09-02 02:00:49][INFO] Server stopped.
[2026-09-02 08:44:40][INFO] Server stopped.
[2026-09-02 09:05:58][INFO] Server stopped.
[2026-09-02 14:53:02][INFO] Server stopped.
[2026-09-02 15:15:38][INFO] Server stopped.


---------------
Topic Ventes || Topic Jeux Vidéos || Topic Téléphonie (Rien pour le moment)
n°47291
neo world
Posté le 02-09-2026 à 16:06:48  profilanswer
 

the_fennec a écrit :

C'est magnifique :love:
T'as tout ça avec l'API de llama.cpp ou tu choppes des trucs en plus?
 
Perso ça sera la map des layers en mémoire(s) que je voudrais. J'ai trouvé ça:
https://github.com/gpustack/gguf-parser-go
 
Mais Windows defender me dit qu'il y a un trojan dans les binaires alors j'ai pas insisté. Virustotal est presque green, donc je pense que c'est un faux positif, mais je testerais dans une semaine :o


Toute la partie stat des tokens en effet :jap: Pour la partie hardware ça vient de rocm-smi il est capable de te former des outputs en json :jap:
 
Y'a de quoi faire niveau projets pour environnement de travail. J'aurais voulu les stats des tokens utilisables vs reasonning mais à priori il aurait fallu passer par un proxy pour les différencier. Je reste sur ça pour le moment :D

n°47292
neo world
Posté le 02-09-2026 à 16:09:43  profilanswer
 

b-tzu a écrit :


Contexte de 4K, logs vide  
[2026-09-02 02:00:49][INFO] Server stopped.
[2026-09-02 08:44:40][INFO] Server stopped.
[2026-09-02 09:05:58][INFO] Server stopped.
[2026-09-02 14:53:02][INFO] Server stopped.
[2026-09-02 15:15:38][INFO] Server stopped.


chope celui là (gguf)  
https://rehost.diberie.com/Picture/Get/f/540714
 
Si ça donne rien redémarre le mac, repasse lui la ligne de commande que je t'avais donné (elle est annulée après chaque reboot donc si maj ou autre ...) et relance le modèle :jap:

n°47294
b-tzu
Geek a toute heure...
Posté le 02-09-2026 à 16:13:24  profilanswer
 

je teste avec llama.cpp la, justement le GGUF. DL en cours


---------------
Topic Ventes || Topic Jeux Vidéos || Topic Téléphonie (Rien pour le moment)
n°47295
neo world
Posté le 02-09-2026 à 16:18:19  profilanswer
 

Bonne idée après j'ai jamais eu de soucis avec lmstudio même en étant très limite sur la mémoire dispo


Message édité par neo world le 02-09-2026 à 16:18:39
n°47300
AllenMadis​on
Oracle du Keb's
Posté le 02-09-2026 à 16:59:14  profilanswer
 

the_fennec a écrit :

 

C'est pas mal en chiffre brut, mais il faut mettre ça en rapport avec le compute. Les cartes AMD et NV sont a 600W, il est peu probable qu'Intel soit aussi efficace, mais admettons qu'elle soit juste que 2x plus lente avec ses 350W. AMD a 144GB et NV 96GB, le rapport compute/VRAM est complètement déséquilibré, on a 2x moins de compute pour 4/5x plus de RAM.

 

Si l'archi de Qwen4 se démocratise avec ses ngrams sur SSD ou même RAM, cette carte en version 480GB sera pas pertinente. Après ça doit pas coûter grand-chose a Intel d'ajouter plus ou moins de RAM. Une carte dans les 100GB a bon prix pourrait être intéressante.

 

La chose qui me fait dire qu'Intel a peut-être quelque chose de performant en compute, c'est justement qu'ils foutent un paquet de ram. Au prix ou est la ram, ce serait débile de mettre autant de ram sur un truc de merde, non ?

 

Surtout qu'en compute, intel c'est pas les premiers venus qui découvrent

Message cité 2 fois
Message édité par AllenMadison le 02-09-2026 à 17:04:35

---------------
Nothing much to teach, man. There's ze high, there's ze low and yall still fucking miss.
n°47302
neo world
Posté le 02-09-2026 à 17:11:10  profilanswer
 

Pour ceux qui se posent la question de pi.dev / Hermes / Openclaw avec une ia locale en backend. Voici mon experience :
=> Openclaw : marche bien mais il est un peu chien fou (tu peux accéder à ce repo ? Ah bah oui, j'en ai lu le nom donc je me suis permis de développer un produit et de l'y commit sans rien demander de plus  [:lex123:2] ) et legerement fini à la pisse (llama qui passe son temps à passer les requetes en mode plain text parce que y'a des caractères interdits une requête sur deux, refus de passer la gateway de communication sur autre chose sur le modèle fourni au premier démarrage de l'app ...) en plus de bruler des tokens sans lendemain
=> Hermes : carré et bien bordé au niveau de l'app. Par contre un peu trop verbeux sur les canaux de communication (toutes les 5 minutes un nouveau message pour me dire qu'il bosse toujours [:simchevelu]  . à tendance à demander plein de trucs pour des raisons de sécurité mais sans attendre la réponse (c'est con je regarde pas chaque seconde ce qu'il fait et je sais pas si /approve est intéressant vu tout ce qu'il s'est passé depuis)
=> Pi.dev la plateforme des barbus  [:gaston10241:2] . Ca roule mais il a aucun moyen de tweaker ses paramètres automatiquement ou de te proposer des correctifs donc ça crash violent  [:outatime] sans prévenir mais heureusement c'est facile à troubleshooter parce qu'il a ecrit tout ce qu'il fait / pensé juste au dessus et la config de base est super minimaliste. C'est un peu rustique, comme une distrib d'il y a 20 ans, mais si tu es prêt à lui donner de l'attention il te le rendra  [:love_yvele] :D

Message cité 1 fois
Message édité par neo world le 02-09-2026 à 17:12:12
n°47304
neo world
Posté le 02-09-2026 à 17:12:53  profilanswer
 

AllenMadison a écrit :


 
La chose qui me fait dire qu'Intel a peut-être quelque chose de performant en compute, c'est justement qu'ils foutent un paquet de ram. Au prix ou est la ram, ce serait débile de mettre autant de ram sur un truc de merde, non ?
 
Surtout qu'en compute, intel c'est pas les premiers venus qui découvrent


dis ça à huawei et ses acelerateurs il y a un an :o

n°47306
moyen_moin​s
chat réincarné
Posté le 02-09-2026 à 17:15:15  profilanswer
 

little coder que j'avais testé, il a pas aimé qwen 3.8 en xhigh, il coupait le raisonnement et produisait rien :lol:

n°47308
the_fennec
f3nn3cUs z3rd4
Posté le 02-09-2026 à 17:19:27  profilanswer
 

AllenMadison a écrit :

La chose qui me fait dire qu'Intel a peut-être quelque chose de performant en compute, c'est justement qu'ils foutent un paquet de ram. Au prix ou est la ram, ce serait débile de mettre autant de ram sur un truc de merde, non ?
 
Surtout qu'en compute, intel c'est pas les premiers venus qui découvrent


 
On verra bien, mais ça serait pas la première fois qu'une boite sort un produit juste pour occuper le terrain :(
 
 [:krusty le clown:5]


---------------
Faudra que je teste un jour :o
n°47309
the_fennec
f3nn3cUs z3rd4
Posté le 02-09-2026 à 17:20:55  profilanswer
 

moyen_moins a écrit :

little coder que j'avais testé, il a pas aimé qwen 3.8 en xhigh, il coupait le raisonnement et produisait rien :lol:


 
Pareil, il a pris sa retraite et claude a repris sa place. Le truc chiant c'est que Qwen quand on lui coupe son thinking ... ben il le reprend :lol:


---------------
Faudra que je teste un jour :o
n°47310
the_fennec
f3nn3cUs z3rd4
Posté le 02-09-2026 à 17:26:46  profilanswer
 

neo world a écrit :


=> Pi.dev la plateforme des barbus  [:gaston10241:2] . Ca roule mais il a aucun moyen de tweaker ses paramètres automatiquement ou de te proposer des correctifs donc ça crash violent  [:outatime] sans prévenir mais heureusement c'est facile à troubleshooter parce qu'il a ecrit tout ce qu'il fait / pensé juste au dessus et la config de base est super minimaliste. C'est un peu rustique, comme une distrib d'il y a 20 ans, mais si tu es prêt à lui donner de l'attention il te le rendra  [:love_yvele] :D


 
Pour pi.dev, j'aime bien le fait qu'il soit en yolo par défaut. Après, je lui ait ajouté des plugins, et la ça devient un peu le bordel comme OpenClaw rapidement avec des trucs vibe-codés/vérolés :o. Ça aide pas non plus que je change de modèle tout les deux jours. Au final little-coder était ce a quoi je voulais arriver, mais il est trop interventionniste a mon gout.  


---------------
Faudra que je teste un jour :o
n°47319
b-tzu
Geek a toute heure...
Posté le 02-09-2026 à 17:45:47  profilanswer
 

@neo world
ca marche avec llama.cpp, jai demandé a claude cli de faire des tests et des comparatifs. jai q3kxl, Q4KM et IQ4XS. ca me donne a peu pres du 5 token/s, petit contexte... le probleme nest pas la en fait. en fanlesse, le MBA chauffe tres vite et evidemment il throttle. donc si je veux faire de lia locale avec mon macbook, cest sur un pro ou rien (enfin jai limpression)
Merci pour le test cetait interessant


---------------
Topic Ventes || Topic Jeux Vidéos || Topic Téléphonie (Rien pour le moment)
n°47322
neo world
Posté le 02-09-2026 à 18:01:52  profilanswer
 

Tu as demandé à l’ia si tu pouvais avoir mieux avec un support ventilé ou les solutions avec du refroidissement actif (plaque watercoolee ou pelletier). Mais en effet même le 14 pouces throttle parce qu’il n’a qu’un seul ventilateur :pt1cable:

n°47323
the_fennec
f3nn3cUs z3rd4
Posté le 02-09-2026 à 18:03:44  profilanswer
 

J'avais jamais remarqué, peut être que c'est nouveau, mais on a des stats mémoire quand on quitte llama.cpp:
 
https://i.imgur.com/1fqYRup.png


---------------
Faudra que je teste un jour :o
n°47326
neo world
Posté le 02-09-2026 à 18:18:26  profilanswer
 

the_fennec a écrit :


 
Pour pi.dev, j'aime bien le fait qu'il soit en yolo par défaut. Après, je lui ait ajouté des plugins, et la ça devient un peu le bordel comme OpenClaw rapidement avec des trucs vibe-codés/vérolés :o. Ça aide pas non plus que je change de modèle tout les deux jours. Au final little-coder était ce a quoi je voulais arriver, mais il est trop interventionniste a mon gout.  


Interventionniste dans quel sens ? Ça posait quel genre de problème ?

n°47327
neo world
Posté le 02-09-2026 à 18:20:09  profilanswer
 

the_fennec a écrit :

J'avais jamais remarqué, peut être que c'est nouveau, mais on a des stats mémoire quand on quitte llama.cpp:
 
https://i.imgur.com/1fqYRup.png


Si tout va bien j’arrête plus le mien. Je vais juste lui ajouter un 27b débridé pour un agent Check code / sécurité :D

n°47330
b-tzu
Geek a toute heure...
Posté le 02-09-2026 à 19:07:24  profilanswer
 

neo world a écrit :

Tu as demandé à l’ia si tu pouvais avoir mieux avec un support ventilé ou les solutions avec du refroidissement actif (plaque watercoolee ou pelletier). Mais en effet même le 14 pouces throttle parce qu’il n’a qu’un seul ventilateur :pt1cable:


Ca ne m'interesse pas. je bouge trop pour me poser, je suis rarement sur un bureau fixe (et chez moi j'ai une 3090 qui arrive, ce sera plutot elle qui fera tourner un bon 3.8 en 27B).  
Le 14 pouces a 1 seul ventilateur en MX simple, en MX Pro / MX Max il en a deux.


---------------
Topic Ventes || Topic Jeux Vidéos || Topic Téléphonie (Rien pour le moment)
n°47332
neo world
Posté le 02-09-2026 à 19:18:49  profilanswer
 

b-tzu a écrit :


Ca ne m'interesse pas. je bouge trop pour me poser, je suis rarement sur un bureau fixe (et chez moi j'ai une 3090 qui arrive, ce sera plutot elle qui fera tourner un bon 3.8 en 27B).  
Le 14 pouces a 1 seul ventilateur en MX simple, en MX Pro / MX Max il en a deux.


Bon compromis. Tu as le mm studio link qui je crois est gratuit et te permettrait d’utiliser ta 3090 de n’importe où :jap:

n°47334
speedboyz3​0
Guide Michelin :o
Posté le 02-09-2026 à 19:29:56  profilanswer
 

J'ai aussi regardé pour un Pro mais c'est vite cher :/
Apple me reprend mon M3 Air 550 balles, ça vaut pas le coup.

 

D'où l'idée de le garder et de prendre un studio en plus (ou un GB10 en fonction des prix).

 

Ordre de grandeur en IA agentique :

 

DGX Spark:
8 requêtes simultanées (modèle 7B à quantification Q4), il maintient un débit global exceptionnel de ~620 jetons/s (soit environ 78 jetons/s par flux d'agent)

 

Mac Studio:
Bien que des frameworks tiers comme oMLX corrigent cela via du continuous batching et un cache KV hiérarchisé déchargé sur SSD, l'architecture matérielle d'Apple reste moins performante que CUDA pour le multi-utilisateur. Sur un test à 8 requêtes concurrentes (7B Q4), le Mac Studio M5 Max plafonne à ~340 jetons/s au global (~43 jetons/s par flux d'agent).


Message édité par speedboyz30 le 02-09-2026 à 19:34:52
n°47335
the_fennec
f3nn3cUs z3rd4
Posté le 02-09-2026 à 19:32:00  profilanswer
 

neo world a écrit :


Interventionniste dans quel sens ? Ça posait quel genre de problème ?


 
Déjà je coup de couper le thinking, ça pose plus de problème qu'autre chose je trouve. Qwen 3.8 se remet a résonner, et je trouve que sur 3.6 ça le faisait partir dans des trucs alacon.
J'ai vu aussi que little-coder coupait certains tools, en disait qu'il fallait pas faire comme ça. Si le modèle essayait d’éditer un fichier sans l'avoir lu avant, il l'envoyait bouler.
 
En plus je me prennait la tête a cause de la doc qui dit de changer:
~/.config/little-coder/models.json
 
Mais comme j'avais déjà testé pi.dev seul, il choppe sa config dans ~/.pi/  :pt1cable:  
 
Au final ya une tonne d'extensions, et c'est trop pour un truc léger:
https://github.com/itayinbarr/littl [...] extensions


---------------
Faudra que je teste un jour :o
n°47337
moyen_moin​s
chat réincarné
Posté le 02-09-2026 à 19:34:35  profilanswer
 

pour les strix halo, y'a ça : https://github.com/julianmb/q38rocm
bon, je vois plein de trucs pour améliorer les vitesses, tant niveau quant que moteur.
intéressant :o

n°47351
Pipould's
Posté le 02-09-2026 à 21:22:03  profilanswer
 

moyen_moins a écrit :

pour les strix halo, y'a ça : https://github.com/julianmb/q38rocm
bon, je vois plein de trucs pour améliorer les vitesses, tant niveau quant que moteur.
intéressant :o


 
J'ai jamais reussi a avoir quoique ce soit d'utilisable avec leur quants

n°47368
moyen_moin​s
chat réincarné
Posté le 02-09-2026 à 22:28:35  profilanswer
 

Pipould's a écrit :

 

J'ai jamais reussi a avoir quoique ce soit d'utilisable avec leur quants


Les quants en rocmfpx ?
Avec le fork de llama.cpp ? :(

n°47371
neo world
Posté le 02-09-2026 à 22:38:57  profilanswer
 

perso content du systeme atomic https://atomic.chat/blog/guides/how [...] xt-locally
 
Gros bordel à déployer (le llama qui venait avec lemonade le supporte pas. J'ai du passer par llama compilé exprès avec les bons flags et une integration comme custom cloud provider pour laisser lemonade router entre mes modèles) mais après ça semble rouler. J'attends de tester le soft avant de me prononcer totalement :D
 
edit : passage de la barre de 205k tokens de contexte. Compactage planifié à 240k tokens  [:angellus2:3]


Message édité par neo world le 02-09-2026 à 22:56:44
n°47372
neo world
Posté le 02-09-2026 à 22:47:08  profilanswer
 

ça scan des failles wordpress mais ça ne dit pas non a une API de llm qui traine :o
 
https://rehost.diberie.com/Picture/Get/f/540828
 
 
#sortez couverts :jap:

n°47373
M300A
Posté le 02-09-2026 à 22:59:14  profilanswer
 

GLM 5.3 flash tourne bien chez moi, je suis très content, d'autres utilisateurs moins. Je pense qu'ils promptent en français ou en allemand et se tapent des réponses en chinois. Moi je bosse en anglais et ça ne m'arrive pas.
Je trouve sa capacité de langage humain correcte, similaire à DS4 Flash. C'est un peu plus lent mais c'est plus précis sur les problèmes cachés dans du code complexe.


Message édité par M300A le 02-09-2026 à 23:30:24

---------------
:wq
 Page :   1  2  3  4  5  ..  54  55  56  57  58  59

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)