Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
2858 connectés 

 


Je génère ...
Sondage à 3 choix possibles.
Ce sondage expirera le 20-09-2026 à 10:00




Attention si vous cliquez sur "voir les résultats" vous ne pourrez plus voter

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  50  51  52  ..  60  61  62  63  64  65
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°46831
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 30-08-2026 à 23:49:33  profilanswer
 

Reprise du message précédent :
T'arrive après la guerre , hermess :O


---------------
Victime de girafophobie, mais se soigne.
n°46832
tfpsly
Sly
Posté le 30-08-2026 à 23:59:33  profilanswer
 

the_fennec a écrit :

Bienvenue  :jap:  
 
C'est quoi ta config coté hard?
 
Laisses tomber les vieux modèles, genre qwen2.5 ou Ministral tu perds ton temps.
 
Je te conseillerais d'essayer Qwen 3.6 35B avec des experts mis sur le CPU si tu as de la RAM en abondance ET le template de froggeric:
https://huggingface.co/froggeric/Qw [...] -Templates
 
Q4_K_M
https://huggingface.co/unsloth/Qwen3.6-35B-A3B-GGUF
 
Attention si tu est sous Windows, regarde si tu as des applis qui te bouffent de la VRAM!
 
Tu peux regarder cette vidéo pour avoir de l’inspiration:
https://www.youtube.com/watch?v=8F_5pdcD3HY


Hello  :hello: ,
RTX 3060 12gb et Ryzen 3600X, sous Linux.
 
Ce soir, je teste Qwen 3.6 35B, et effectivement... :love: bien plus "intelligent", 22tk/s soit presque la vitesse de 3.5 29tk/s, fonctionne nickel avec pi.dev; il respecte bien mieux l'architecture de mes projets persos, au lieu de rajouter du code n'importe où...
Mon nouveau choix par défaut, merci!

Code :
  1. llama-server -m ~/models/Qwen3.6-35B-A3B-APEX-I-Compact.gguf -ngl 99 -a Qwen3.6-35B-A3B-APEX-64k --host 0.0.0.0 --port 8080 \
  2.     --fit off -fa on -ot "blk\.(1[5-9]|[2-3][0-9])\.ffn_.*_exps=CPU" --ctx-size 32768  --threads 6 --threads-batch 6 \
  3.     --cpu-range 0-5 --cpu-strict 1 --cpu-range-batch 0-5 --cpu-strict-batch 1 --numa isolate --prio 2 --mmap --parallel 1 --jinja \
  4.     --cache-type-k q4_0 --cache-type-v q4_0 --ubatch-size 256 --batch-size 512 --cache-reuse 256 --ctx-checkpoints 8 --metrics


 
Je dois pouvoir pousser un peu plus de chose sur GPU, nvidia-smi indiquant smax 60% de la VRAM utilisée.
 
 
EDIT - 33tk/s (et prompt eval > 180tk/s) avec un plus gros contexte :love:

Code :
  1. llama-server -m ~/models/Qwen3.6-35B-A3B-APEX-I-Compact.gguf -ngl 99 -a Qwen3.6-35B-A3B-APEX-64k --host 0.0.0.0 --port 8080 \
  2.     --fit off -fa on -ot "blk\.([2-3][0-9])\..*exps=CPU" --ctx-size 45000  --threads 6 --threads-batch 6 \
  3.     --cpu-range 0-5 --cpu-strict 1 --cpu-range-batch 0-5 --cpu-strict-batch 1 --numa isolate --prio 2 --mmap --parallel 1 --jinja \
  4.     --cache-type-k q4_0 --cache-type-v q4_0 --ubatch-size 256 --batch-size 512 --cache-reuse 256 --ctx-checkpoints 8 --metrics


EDIT - 37tk/s (et prompt eval > 200tk/s)  avec context de 32k

Code :
  1. llama-server -m ~/models/Qwen3.6-35B-A3B-APEX-I-Compact.gguf --host 0.0.0.0 --port 8080 \
  2.     --fit on --fit-ctx 32768 --fit-target 1024 -fa on --ctx-size 32768  --threads 6 --threads-batch 6 \
  3.     --cpu-range 0-5 --cpu-strict 1 --cpu-range-batch 0-5 --cpu-strict-batch 1 --numa isolate --prio 2 --mmap --parallel 1 --jinja \
  4.     --cache-type-k q4_0 --cache-type-v q4_0 --ubatch-size 256 --batch-size 512 --cache-reuse 256 --ctx-checkpoints 8 --metrics

Message cité 1 fois
Message édité par tfpsly le 31-08-2026 à 01:05:23
n°46833
neo world
Posté le 31-08-2026 à 00:02:12  profilanswer
 

Tronklou a écrit :

T'arrive après la guerre , hermess :O


 
je fini quand même de le configurer (nextcloud talk, repo git local, accès à internet) avant de basculer vers hermes une fois que je me serais fait une idée du bestiau sur un projet minimaliste :jap:


Message édité par neo world le 31-08-2026 à 00:03:02
n°46835
Jeanmanchz​eck
Posté le 31-08-2026 à 00:28:37  profilanswer
 

neo world a écrit :

Bordel Je test tout juste openclaw. J'installe, je pointe vers mon lemonade strix halo, j'écris "hey" dans le chat ...
Input token 17000  [:elena gates:2]

 

Bon du coup ça crash pas. C'est juste pas le problème d'openclaw tout ce qui est frugalité :o


non c'est logique, le premier input charge la conf

Message cité 1 fois
Message édité par Jeanmanchzeck le 31-08-2026 à 00:30:23
n°46836
neo world
Posté le 31-08-2026 à 00:55:35  profilanswer
 

Jeanmanchzeck a écrit :


non c'est logique, le premier input charge la conf


C'est ultra bourrin. j'avais zero module de chargé. Y'a clairement une petite opti à faire sur l'onboarding :lol:  
 
Bon sinon j'ai pété la RAM (ça a réussi à tenir à 124,9GO de charge pendant quelques minutes en crachant environ 16 tokens/seconde ... puis j'ai mon job de backup qui a démarré automatiquement en vampirisant tout ce qu'il pouvait (3 coeurs de CPU et de la RAM mais j'ai pas pu voir ce dernier  :lol: ) pour calculer quoi faire et démarrer la dedup'... Chérie ça a coupé :o
 
https://sleepingrobots.com/dreams/e [...] trix-halo/
Y'a 13 tokens / seconde supplémentaires à aller chercher  [:cerveau nico54]  
On va dégager la partie backup. Le truc peut cramer à tout moment de toute façon  [:jeje84:1] :o

Message cité 1 fois
Message édité par neo world le 31-08-2026 à 00:57:26
n°46837
neo world
Posté le 31-08-2026 à 01:44:44  profilanswer
 

Connexion smooth via Nextcloud Talk :D
 
Par contre j'ai rétrogradé le modèle au 3.8 27b : les messages étaient insuportablement longs et sur la console du strix halo le GPU prenait à rester à 80% d'usage pendant que le CPU prenait 20 à 30% de conso. Faut que je reprenne mes paramètres llma cpp qui étaient pensées pour le 27b et pas du tout pour flash next :jap:

Message cité 1 fois
Message édité par neo world le 31-08-2026 à 01:54:02
n°46838
Pipould's
Posté le 31-08-2026 à 02:04:44  profilanswer
 

neo world a écrit :


C'est ultra bourrin. j'avais zero module de chargé. Y'a clairement une petite opti à faire sur l'onboarding :lol:

 

Bon sinon j'ai pété la RAM (ça a réussi à tenir à 124,9GO de charge pendant quelques minutes en crachant environ 16 tokens/seconde ... puis j'ai mon job de backup qui a démarré automatiquement en vampirisant tout ce qu'il pouvait (3 coeurs de CPU et de la RAM mais j'ai pas pu voir ce dernier  :lol: ) pour calculer quoi faire et démarrer la dedup'... Chérie ça a coupé :o

 

https://sleepingrobots.com/dreams/e [...] trix-halo/
Y'a 13 tokens / seconde supplémentaires à aller chercher  [:cerveau nico54]
On va dégager la partie backup. Le truc peut cramer à tout moment de toute façon  [:jeje84:1] :o

 

Bah a chaque fois que je lance une session Claude code le truc a 30k de contexte a remonter... 17k ne m'étonne pas trop.

 

Par contre c'est clairement le prefill qui tue le Strix, la génération, bof.

n°46839
neo world
Posté le 31-08-2026 à 02:12:29  profilanswer
 

Pipould's a écrit :


Par contre c'est clairement le prefill qui tue le Strix, la génération, bof.


https://external-content.duckduckgo.com/iu/?u=https%3A%2F%2Feproshopping.cloud%2Fmedia%2F7ed6600e2ea00bb1902851909c24b092b6793674%2Fproduit%2Fb85981e30fcc6298cf17cdf56b73ce11ad50dff1.jpg&f=1&nofb=1&ipt=ef56206e355161f24b728e4287fe1e84be74a0d252c3202d1d83d43ee65f796f
 
:o
 
Pour préciser quand même une réponse simple (question bateau sur la config d'openclaw) arrive en moins d'une minute avec le modèle 27b.
 

Message cité 1 fois
Message édité par neo world le 31-08-2026 à 02:55:05
n°46843
Pipould's
Posté le 31-08-2026 à 07:43:51  profilanswer
 

neo world a écrit :


https://external-content.duckduckgo [...] 3ee65f796f

 

:o

 

Pour préciser quand même une réponse simple (question bateau sur la config d'openclaw) arrive en moins d'une minute avec le modèle 27b.

 


 

Je persiste a penser que j'ai un souci dans la méthode d'utilisation...

 

Mais en même temps mon dual de 3090 est production ready

n°46849
neo world
Posté le 31-08-2026 à 09:26:37  profilanswer
 

Clairement des cartes cuda avec tensorcore et nvlink c’est quand même plus chouette en terme de vitesse. Je finirai probablement sur quelque chose de similaire mais dans le cadre d’un homelab le strix halo dépanne bien :)

n°46853
the_fennec
f3nn3cUs z3rd4
Posté le 31-08-2026 à 09:56:36  profilanswer
 

neo world a écrit :

Bordel Je test tout juste openclaw. J'installe, je pointe vers mon lemonade strix halo, j'écris "hey" dans le chat ...
Input token 17000  [:elena gates:2]  
 
Bon du coup ça crash pas. C'est juste pas le problème d'openclaw tout ce qui est frugalité :o


 
En plus d'être codé avec le cul, openclaw n'est pas prévu pour un modèle local. Ya une version 2.0 qui sort, pas sur que ça soit mieux...


---------------
Faudra que je teste un jour :o
n°46854
the_fennec
f3nn3cUs z3rd4
Posté le 31-08-2026 à 10:00:29  profilanswer
 

tfpsly a écrit :


Hello  :hello: ,
RTX 3060 12gb et Ryzen 3600X, sous Linux.
 
Ce soir, je teste Qwen 3.6 35B, et effectivement... :love: bien plus "intelligent", 22tk/s soit presque la vitesse de 3.5 29tk/s, fonctionne nickel avec pi.dev; il respecte bien mieux l'architecture de mes projets persos, au lieu de rajouter du code n'importe où...
...
 
EDIT - 37tk/s (et prompt eval > 200tk/s)  avec context de 32k

Code :
  1. llama-server -m ~/models/Qwen3.6-35B-A3B-APEX-I-Compact.gguf --host 0.0.0.0 --port 8080 \
  2.     --fit on --fit-ctx 32768 --fit-target 1024 -fa on --ctx-size 32768  --threads 6 --threads-batch 6 \
  3.     --cpu-range 0-5 --cpu-strict 1 --cpu-range-batch 0-5 --cpu-strict-batch 1 --numa isolate --prio 2 --mmap --parallel 1 --jinja \
  4.     --cache-type-k q4_0 --cache-type-v q4_0 --ubatch-size 256 --batch-size 512 --cache-reuse 256 --ctx-checkpoints 8 --metrics



 
Cool ça progresse bien :jap:
 
Je te conseille d'essayer de passer en --cache-type-k q8_0 --cache-type-v q8_0 si possible, ça fait une bonne différence sur la qualité du contexte.


---------------
Faudra que je teste un jour :o
n°46859
the_fennec
f3nn3cUs z3rd4
Posté le 31-08-2026 à 10:07:45  profilanswer
 

neo world a écrit :

Faut que je reprenne mes paramètres llma cpp qui étaient pensées pour le 27b et pas du tout pour flash next :jap:


 
Le support de Qwen4 est encore jeune, ya pas mal de PR en cours. Ils viennent de merger un opti pour les ngram, une autre arrive pour le support de MTP. Il vont aussi renomer le lazyloading, mais c'est automatique pour les tensor > 5GB.


---------------
Faudra que je teste un jour :o
n°46864
tfpsly
Sly
Posté le 31-08-2026 à 10:26:20  profilanswer
 

the_fennec a écrit :


 
Cool ça progresse bien :jap:
 
Je te conseille d'essayer de passer en --cache-type-k q8_0 --cache-type-v q8_0 si possible, ça fait une bonne différence sur la qualité du contexte.


Oui je vois qu'il y a plus de tunning à faire... Codacus (qui atteignait 17tk/s sur une 1060 6gb) atteint 80tk/s sur ma carte : https://www.youtube.com/watch?v=k_LostFpatg

n°46868
the_fennec
f3nn3cUs z3rd4
Posté le 31-08-2026 à 10:51:19  profilanswer
 

tfpsly a écrit :


Oui je vois qu'il y a plus de tunning à faire... Codacus (qui atteignait 17tk/s sur une 1060 6gb) atteint 80tk/s sur ma carte : https://www.youtube.com/watch?v=k_LostFpatg


 
Attention pour cette vidéo il s'est fait un fork de llama.cpp. Dans une vidéo plus récente il explique qu'il a mal compris comment les MoE fonctionnent. Je te conseilles de rester sur la branch principale de llama.cpp.
 
De plus il utilise Qwen3.6-35B-A3B  UD-Q4_K_M d'Unsloth et toi ceux de les APEX mudler.


---------------
Faudra que je teste un jour :o
n°46872
moyen_moin​s
chat réincarné
Posté le 31-08-2026 à 11:21:18  profilanswer
 

j'ai testé le qwen 3.8 27B Q4+ d'atomic chat pour un de mes projets en cours, en mode par défaut (avec reasoning passé sur moyen) et c'est long... bon, tout reste en local mais ça se paie :sweat:
 
j'arrive à caser un contexte de 105k environ sur mes 2 cartes mais le pp d'une centaine de t/s et le tg qui oscille entre 10 et 20t/s, je sais jamais si ça a planté ou si les cartes ont du mal à digérer tous ces tokens au bout d'un moment :sweat:
faut que je revois l'architecture du truc, que je teste le résultat en Low où que j'investisse [:paysan]

n°46875
epsiloncen​taury
Posté le 31-08-2026 à 12:06:18  profilanswer
 

Vous pensez que cela peut le faire une GTX 1080  8Go pour l'IA local . J'en ai marre de mon montage bancal qui ne sert qu'a faire mumuse..  :o

n°46876
the_fennec
f3nn3cUs z3rd4
Posté le 31-08-2026 à 12:07:40  profilanswer
 

moyen_moins a écrit :

j'ai testé le qwen 3.8 27B Q4+ d'atomic chat pour un de mes projets en cours, en mode par défaut (avec reasoning passé sur moyen) et c'est long... bon, tout reste en local mais ça se paie :sweat:
 
j'arrive à caser un contexte de 105k environ sur mes 2 cartes mais le pp d'une centaine de t/s et le tg qui oscille entre 10 et 20t/s, je sais jamais si ça a planté ou si les cartes ont du mal à digérer tous ces tokens au bout d'un moment :sweat:
faut que je revois l'architecture du truc, que je teste le résultat en Low où que j'investisse [:paysan]


 
 
Si tu as activé le MTP c'est normal que le tg oscille. Si ton draft MTP est trop haut, tu peux être plus lent que sans. Plus ton contexte grossis, plus le PP baisse, c'est normal.
 
Tu peux désactiver le MTP pour gagner en VRAM.

Message cité 1 fois
Message édité par the_fennec le 31-08-2026 à 12:07:58

---------------
Faudra que je teste un jour :o
n°46877
AllenMadis​on
Oracle du Keb's
Posté le 31-08-2026 à 12:07:54  profilanswer
 

moyen_moins a écrit :

j'ai testé le qwen 3.8 27B Q4+ d'atomic chat pour un de mes projets en cours, en mode par défaut (avec reasoning passé sur moyen) et c'est long... bon, tout reste en local mais ça se paie :sweat:
 
j'arrive à caser un contexte de 105k environ sur mes 2 cartes mais le pp d'une centaine de t/s et le tg qui oscille entre 10 et 20t/s, je sais jamais si ça a planté ou si les cartes ont du mal à digérer tous ces tokens au bout d'un moment :sweat:
faut que je revois l'architecture du truc, que je teste le résultat en Low où que j'investisse [:paysan]


 
Idealement faudrait investir mais mais comme j'ai déjà dit, investir maintenant c'est pas le bon plan, entre la pénurie de ram au prix fort, les cartes qui coutent un rein (et qui vont être obsoletes d'ici un an). Quitte à payer le prix fort, autant attendre les ryzen 495max ou les prochaines cartes nvidia qui sortent d'ici un an/un an et demi
 
même les hx170 ou les bc250 ont vu leur prix décoller  
 

epsiloncentaury a écrit :

Vous pensez que cela peut le faire une GTX 1080  8Go pour l'IA local . J'en ai marre de mon montage bancal qui ne sert qu'a faire mumuse..  :o


 
Ca "passe" pour des tout petits modèles, j'ai une 3080 10GB qui fait tourner correctement les petits modèles qwen mais oublie les gros modèles (ceux qui ont 27B ou 35b de parametres). Plus tu veux un modèle perf (donc avec bcp de parametres) plus il faut de la ram (et la bande passante qui suit, indeed).  
 
Donc soit tu arrives a mettre la main sur une CG pas trop chere (les bc250, oublie les hx170 elle se sont envolées a 1200+) voire une AMD avec 16gb de ram a 300€, et tu t'en contentes pour faire joujou en local, soit tu fais péter la tirelire avec un ryzen 395 pour faire mumuse mais dans un an il est obsolete  [:zedlefou:1]

Message cité 3 fois
Message édité par AllenMadison le 31-08-2026 à 12:14:47

---------------
Nothing much to teach, man. There's ze high, there's ze low and yall still fucking miss.
n°46878
the_fennec
f3nn3cUs z3rd4
Posté le 31-08-2026 à 12:09:42  profilanswer
 

epsiloncentaury a écrit :

Vous pensez que cela peut le faire une GTX 1080  8Go pour l'IA local . J'en ai marre de mon montage bancal qui ne sert qu'a faire mumuse..  :o


 
Tout dépends de ce que tu veux faire tourner, mais un petit MoE peut tourner correctement. Après 16GB de VRAM c'est quand même mieux :o
De quel montage tu parles?


---------------
Faudra que je teste un jour :o
n°46879
tfpsly
Sly
Posté le 31-08-2026 à 12:10:06  profilanswer
 

epsiloncentaury a écrit :

Vous pensez que cela peut le faire une GTX 1080  8Go pour l'IA local . J'en ai marre de mon montage bancal qui ne sert qu'a faire mumuse..  :o


Ca peut - Qwen 3.6 35B MoE à 17tk sur une 1060 6gb :
https://www.youtube.com/watch?v=8F_5pdcD3HY

n°46880
the_fennec
f3nn3cUs z3rd4
Posté le 31-08-2026 à 12:10:16  profilanswer
 

AllenMadison a écrit :


 
Idealement faudrait investir mais mais comme j'ai déjà dit, investir maintenant c'est pas le bon plan, entre la pénurie de ram au prix fort, les cartes qui coutent un rein (et qui vont être obsoletes d'ici un an). Quitte à payer le prix fort, autant attendre les ryzen 495max ou les prochaines cartes nvidia qui sortent d'ici un an/un an et demi
 
même les hx170 ou les bc250 ont vu leur prix décoller


 
Genre les prix vont baisser l'année prochaine :lol:


---------------
Faudra que je teste un jour :o
n°46881
AllenMadis​on
Oracle du Keb's
Posté le 31-08-2026 à 12:15:57  profilanswer
 

the_fennec a écrit :

 

Genre les prix vont baisser l'année prochaine :lol:

 

Non les prix ne vont probablement pas baisser, mais quitte a y mettre un rein, autant attendre un an pour avoir des specs correctes. Sur le fond, "investir" dans le hardware maintenant sachant que dans un an les nouvelles gen sortent et ne seront pas renouvelées avant 3/4 ans ce n'est pas le move futé. Après ça sera toujours en pleine pénurie + les constructeurs greedy qui voudront facturer l'IA au prix fort donc il ne faudra pas s'attendre a une baisse de prix. Déjà Apple qui facture 10k€ sa machine c'est du foutage de gueule de compet'


Message édité par AllenMadison le 31-08-2026 à 12:25:08

---------------
Nothing much to teach, man. There's ze high, there's ze low and yall still fucking miss.
n°46882
the_fennec
f3nn3cUs z3rd4
Posté le 31-08-2026 à 12:24:44  profilanswer
 

It's aliiiive:
 [:domo-kun]  
 
https://i.imgur.com/7g7O2Ab.png
 
Le build b10714 de llama.cpp a réglé mon plantage RPC :love:  
 
Je suis sur Qwen3.8-Flash-Next-UD-IQ1_S avec 32k de contexte, mais je pense pas que j'aurais mon flappy bird, il est déjà a 11k de thinking!
 
Je suis a 8.68 de tg/s plus rapide que 27B... mais pas les mêmes quants. J'ai que 15GB de RAM occupé, et il doit bien me rester 2/3GB de VRAM en tout. J'ai que 2 layers en CPU, donc je pense pouvoir charger peut être un Q4? Ce qui est chiant c'est que les layers sont gros, c'est difficile de bien les répartir sur les GPUs.
 
edit: j'ajoute que le chargement est bien plus rapide, les ngram sont laissés sur le disk. J'ai --lazy-mode on et --load-mode none

Message cité 2 fois
Message édité par the_fennec le 31-08-2026 à 12:28:01

---------------
Faudra que je teste un jour :o
n°46883
moyen_moin​s
chat réincarné
Posté le 31-08-2026 à 12:24:51  profilanswer
 

the_fennec a écrit :


 
 
Si tu as activé le MTP c'est normal que le tg oscille. Si ton draft MTP est trop haut, tu peux être plus lent que sans. Plus ton contexte grossis, plus le PP baisse, c'est normal.
 
Tu peux désactiver le MTP pour gagner en VRAM.


j'ai été assez conservateur sur le MTP (0 min - 3 max et proba 0.5).
faut que j'essaie sans :jap:

n°46884
moyen_moin​s
chat réincarné
Posté le 31-08-2026 à 12:25:37  profilanswer
 

AllenMadison a écrit :


 
Idealement faudrait investir mais mais comme j'ai déjà dit, investir maintenant c'est pas le bon plan, entre la pénurie de ram au prix fort, les cartes qui coutent un rein (et qui vont être obsoletes d'ici un an). Quitte à payer le prix fort, autant attendre les ryzen 495max ou les prochaines cartes nvidia qui sortent d'ici un an/un an et demi
 
même les hx170 ou les bc250 ont vu leur prix décoller  
 


les 495 max, ça va changer quoi à part la quantité de ram ?

n°46885
AllenMadis​on
Oracle du Keb's
Posté le 31-08-2026 à 12:28:37  profilanswer
 

the_fennec a écrit :

It's aliiiive:
 [:domo-kun]

 

https://i.imgur.com/7g7O2Ab.png

 

Le build b10714 de llama.cpp a réglé mon plantage RPC :love:

 

Je suis sur Qwen3.8-Flash-Next-UD-IQ1_S avec 32k de contexte, mais je pense pas que j'aurais mon flappy bird, il est déjà a 11k de thinking!

 

Je suis a 8.68 de tg/s plus rapide que 27B... mais pas les mêmes quants. J'ai que 15GB de RAM occupé, et il doit bien me rester 2/3GB de VRAM en tout. J'ai que 2 layers en CPU, donc je pense pouvoir charger peut être un Q4? Ce qui est chiant c'est que les layers sont gros, c'est difficile de bien les répartir sur les GPUs.

 

edit: j'ajoute que le chargement est bien plus rapide, les ngram sont laissés sur le disk. J'ai --lazy-mode on et --load-mode none

 

Tu peux peut-être tenter un snake sur casio ? :o


Message édité par AllenMadison le 31-08-2026 à 12:28:54

---------------
Nothing much to teach, man. There's ze high, there's ze low and yall still fucking miss.
n°46886
the_fennec
f3nn3cUs z3rd4
Posté le 31-08-2026 à 12:29:12  profilanswer
 

moyen_moins a écrit :


j'ai été assez conservateur sur le MTP (0 min - 3 max et proba 0.5).
faut que j'essaie sans :jap:


 
Perso j'ai juste ça: --spec-type draft-mtp --spec-draft-n-max 2


---------------
Faudra que je teste un jour :o
n°46887
AllenMadis​on
Oracle du Keb's
Posté le 31-08-2026 à 12:33:57  profilanswer
 

moyen_moins a écrit :


les 495 max, ça va changer quoi à part la quantité de ram ?

 

Plus de ram et une bande passante légèrement meilleure, même si 273gb de bande passante c'est seulement 6% par rapport aux 395

 

Idéalement il faudrait 256gb de ram + 1700gb de bande passante \o/

Message cité 2 fois
Message édité par AllenMadison le 31-08-2026 à 12:38:11

---------------
Nothing much to teach, man. There's ze high, there's ze low and yall still fucking miss.
n°46888
epsiloncen​taury
Posté le 31-08-2026 à 12:35:39  profilanswer
 

tfpsly a écrit :


Ca peut - Qwen 3.6 35B MoE à 17tk sur une 1060 6gb :
https://www.youtube.com/watch?v=8F_5pdcD3HY


 
17tk sur une 6Go  :heink:  :??:
 
Edit : J'avais oublié la vidéo de Codacus..  :D


Message édité par epsiloncentaury le 31-08-2026 à 12:37:35
n°46889
neo world
Posté le 31-08-2026 à 12:37:04  profilanswer
 
n°46892
epsiloncen​taury
Posté le 31-08-2026 à 12:39:47  profilanswer
 

Du coup, j'ai acheté les deux pour 140€ . Je pense que jai fait une bonne affaire, vu les prix de la VRam actuellement  :)

n°46894
the_fennec
f3nn3cUs z3rd4
Posté le 31-08-2026 à 12:41:05  profilanswer
 


 :jap:  
 
Ya un bouton "skip reasoning" dans le UI de llama.cpp :love:  
https://i.imgur.com/Qks5jua.png
 
Du coup je peux voir le PP :

Code :
  1. 45.07.811.587 I slot print_timing: id  0 | task 18040 | prompt processing, n_tokens =   7168, progress = 0.41, t = 118.73 s / 60.37 tokens per second
  2. 45.07.811.592 I slot   operator(): id  0 | task 18040 | cached n_tokens = 7543, memory_seq_rm [7543, end)
  3. 45.16.563.425 I slot print_timing: id  0 | task 18040 | prompt processing, n_tokens =   7680, progress = 0.43, t = 127.48 s / 60.24 tokens per second
  4. 45.16.563.430 I slot   operator(): id  0 | task 18040 | cached n_tokens = 8055, memory_seq_rm [8055, end)


 
 [:cancaner:6]
 
edit:
On la lui fait pas a Qwen Next :o
 
https://i.imgur.com/VRzbzdy.png


Message édité par the_fennec le 31-08-2026 à 12:47:26

---------------
Faudra que je teste un jour :o
n°46895
neo world
Posté le 31-08-2026 à 12:50:19  profilanswer
 

AllenMadison a écrit :


 
Idealement faudrait investir mais mais comme j'ai déjà dit, investir maintenant c'est pas le bon plan, entre la pénurie de ram au prix fort, les cartes qui coutent un rein (et qui vont être obsoletes d'ici un an). Quitte à payer le prix fort, autant attendre les ryzen 495max ou les prochaines cartes nvidia qui sortent d'ici un an/un an et demi
 
Donc soit tu arrives a mettre la main sur une CG pas trop chere (les bc250, oublie les hx170 elle se sont envolées a 1200+) voire une AMD avec 16gb de ram a 300€, et tu t'en contentes pour faire joujou en local, soit tu fais péter la tirelire avec un ryzen 395 pour faire mumuse mais dans un an il est obsolete  [:zedlefou:1]


C'est l'histoire du hardware. Y'a eu quelques très bon timing pour acheter mais encore fallait il le savoir (avant l'envolée du bitcoin pour les cartes graphiques, l'an dernier pour la RAM ou le NVME ...)
 
L'IA locale sur du matos à prix "consommateur très motivé" (prosummer)  c'est un marché de niche bien adressé par Apple (leur gamme max / ultra :love: ) les autres en font mais t'es pas du tout sur de gros volumes de vente ou des marges confortables par rappot à la classique carte acceleratrice: ça va investir à minima pendant très longtemps encore.  
 
Le fait que des nouveaux acteurs s'y intéresse est bon signe (Mi avec en particulier le marché chinois où c'est encore plus bordélique qu'ici de choper du matos Nvidia avec un peu de vRAM) mais c'est encore un an d'attente et ce sera moins stratégique pour eux que de sortir des voitures / smartphones à prix très bien positionné sur un marché à forte concurrence
 
Perso je vais en venir à ce qui était prévu à peu prêt au départ : un modèle frontier en cloud pour la discussion / planification / revue de code / orchestration avec peu de droits (lecture sur la code base) et un modèle local pour le coding / pentest / trucs que refuseront de faire les vendeurs cloud.

n°46896
epsiloncen​taury
Posté le 31-08-2026 à 12:52:53  profilanswer
 

the_fennec a écrit :


 
Tout dépends de ce que tu veux faire tourner, mais un petit MoE peut tourner correctement. Après 16GB de VRAM c'est quand même mieux :o
De quel montage tu parles?


 
Je veux faire une IA local . Mais là,  je change un peu de dimension , meme si la Vram est ancienne. Le gars n'avait pas une, mais deux cartes GTX 1080 qu'il faisait tourner en SLi. j'étais parti pour en acheté qu'une, mais il faisait les deux pour 140€, j'ai craqué. Les cartes n'ont plus le carénage pour tenir dans sa tour. Mais je m'en fout
 
Je me retrouve d'un coup, d'un truc totalement  bancal et improbable, à  16Go de Vram Cuda ..  :D

n°46899
AllenMadis​on
Oracle du Keb's
Posté le 31-08-2026 à 12:58:31  profilanswer
 

neo world a écrit :


C'est l'histoire du hardware. Y'a eu quelques très bon timing pour acheter mais encore fallait il le savoir (avant l'envolée du bitcoin pour les cartes graphiques, l'an dernier pour la RAM ou le NVME ...)

 

L'IA locale sur du matos à prix "consommateur très motivé" (prosummer)  c'est un marché de niche bien adressé par Apple (leur gamme max / ultra :love: ) les autres en font mais t'es pas du tout sur de gros volumes de vente ou des marges confortables par rappot à la classique carte acceleratrice: ça va investir à minima pendant très longtemps encore.

 

Le fait que des nouveaux acteurs s'y intéresse est bon signe (Mi avec en particulier le marché chinois où c'est encore plus bordélique qu'ici de choper du matos Nvidia avec un peu de vRAM) mais c'est encore un an d'attente et ce sera moins stratégique pour eux que de sortir des voitures / smartphones à prix très bien positionné sur un marché à forte concurrence

 

Perso je vais en venir à ce qui était prévu à peu prêt au départ : un modèle frontier en cloud pour la discussion / planification / revue de code / orchestration avec peu de droits (lecture sur la code base) et un modèle local pour le coding / pentest / trucs que refuseront de faire les vendeurs cloud.

 

J'en pense que ça va se calmer, on avait eu en 2018 une pénurie de ram due a une usine qui avait cramé, les prix s'étaient envolés pendant 3-4 ans avant de crash spectaculairement. On est au début de l'IA, il y a encore la ddr6 puis la ddr7 qui vont arriver, ça nécessite les changements de ligne + nécessite pour les compagnies IA de refaire tout leurs datacenter s'ils veulent upgrade (donc un pognon de dingue), je ne pense pas que cette pénurie de ram va durer et qu'on aura de la ram à nouveau bon marché dans quelques temps, quand tout se sera calmé.

 

J'avais prévu de faire mes upgrades de matos en 2028 perso, on verra s'il faut attendre 2030 carrément mais en tout cas à partir de 2028-2029 je monte le truc de centrale nucléaire pour avoir mon IA en local :o

 

En attendant ma 3080 fait le job pour qwen/ollama

Message cité 1 fois
Message édité par AllenMadison le 31-08-2026 à 13:00:20

---------------
Nothing much to teach, man. There's ze high, there's ze low and yall still fucking miss.
n°46900
the_fennec
f3nn3cUs z3rd4
Posté le 31-08-2026 à 13:01:34  profilanswer
 

epsiloncentaury a écrit :


 
Je veux faire une IA local . Mais là,  je change un peu de dimension , meme si la Vram est ancienne. Le gars n'avait pas une, mais deux cartes GTX 1080 qu'il faisait tourner en SLi. j'étais parti pour en acheté qu'une, mais il faisait les deux pour 140€, j'ai craqué. Les cartes n'ont plus le carénage pour tenir dans sa tour. Mais je m'en fout
 
Je me retrouve d'un coup, d'un truc totalement  bancal et improbable, à  16Go de Vram Cuda ..  :D


 
Oui mais une IA locale, si c'est un chatbot pour du RP ça ira. Si c'est pour faire tourner Openclaw, ou du code c'est plus chaud.
 
Un SLI de GTX 1080, je suis curieux de voir le résultat! Le seul truc qui pourrait poser problème, c'est la consommation en idle et peut être aussi en pointe, ça doit taper les 400W facile non?


---------------
Faudra que je teste un jour :o
n°46901
epsiloncen​taury
Posté le 31-08-2026 à 13:05:37  profilanswer
 

the_fennec a écrit :


 
Oui mais une IA locale, si c'est un chatbot pour du RP ça ira. Si c'est pour faire tourner Openclaw, ou du code c'est plus chaud.
 
Un SLI de GTX 1080, je suis curieux de voir le résultat! Le seul truc qui pourrait poser problème, c'est la consommation en idle et peut être aussi en pointe, ça doit taper les 400W facile non?


 
J'ai pas dit que je voulais faire du sli. Le sli ne sert à rien dans l'AI. Et j'ai pas la carte pour faire du sli.

n°46902
the_fennec
f3nn3cUs z3rd4
Posté le 31-08-2026 à 13:09:33  profilanswer
 

AllenMadison a écrit :

J'en pense que ça va se calmer, on avait eu en 2018 une pénurie de ram due a une usine qui avait cramé, les prix s'étaient envolés pendant 3-4 ans avant de crash spectaculairement. On est au début de l'IA, il y a encore la ddr6 puis la ddr7 qui vont arriver, ça nécessite les changements de ligne + nécessite pour les compagnies IA de refaire tout leurs datacenter s'ils veulent upgrade (donc un pognon de dingue), je ne pense pas que cette pénurie de ram va durer et qu'on aura de la ram à nouveau bon marché dans quelques temps, quand tout se sera calmé.  
 
J'avais prévu de faire mes upgrades de matos en 2028 perso, on verra s'il faut attendre 2030 carrément mais en tout cas à partir de 2028-2029 je monte le truc de centrale nucléaire pour avoir mon IA en local :o  
 
En attendant ma 3080 fait le job pour qwen/ollama


 
Si les industriels on laissé tombé la DDR5 pour faire de la HBM, c'est pas pour se remettre a faire de la DDR6 pour les consommateurs...
Le seul truc qui pourrais les faire bouger c'est si les chinois comme CXMT se mettent a faire de la DDR5, mais même eux se mettent a faire de la HBM.
 
Et clairement ce qui s'est passé précédemment ne va pas encourager les industriels a prendre des risques.


---------------
Faudra que je teste un jour :o
n°46903
AllenMadis​on
Oracle du Keb's
Posté le 31-08-2026 à 13:12:57  profilanswer
 

the_fennec a écrit :


 
Si les industriels on laissé tombé la DDR5 pour faire de la HBM, c'est pas pour se remettre a faire de la DDR6 pour les consommateurs...
Le seul truc qui pourrais les faire bouger c'est si les chinois comme CXMT se mettent a faire de la DDR5, mais même eux se mettent a faire de la HBM.
 
Et clairement ce qui s'est passé précédemment ne va pas encourager les industriels a prendre des risques.


 
On verra bien, la ddr6 est toujours prévue (et la ddr7 aussi) d'après AMD. A voir si on n'aura pas tout directement avec de la hbm :o


---------------
Nothing much to teach, man. There's ze high, there's ze low and yall still fucking miss.
n°46905
the_fennec
f3nn3cUs z3rd4
Posté le 31-08-2026 à 13:15:32  profilanswer
 

epsiloncentaury a écrit :


 
J'ai pas dit que je voulais faire du sli. Le sli ne sert à rien dans l'AI. Et j'ai pas la carte pour faire du sli.


 
Au contraire le SLI est très utile pour l'IA, ça te permet d'avoir une BP bien plus élevée que le bus PCIe.  
Si tu mets tes cartes en split-mode=tensor tu pourrais avoir un bon gain en PP et TG.
 
Après c'est la théorie, je sais pas trop ce que ça donne, surtout avec des 1080.


---------------
Faudra que je teste un jour :o
 Page :   1  2  3  4  5  ..  50  51  52  ..  60  61  62  63  64  65

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)