Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
4183 connectés 

 


Je génère ...
Sondage à 3 choix possibles.
Ce sondage expirera le 20-09-2026 à 10:00




Attention si vous cliquez sur "voir les résultats" vous ne pourrez plus voter

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  44  45  46  ..  59  60  61  62  63  64
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°46254
neo world
Posté le 25-08-2026 à 17:43:39  profilanswer
 

Reprise du message précédent :
Nope ce soir ça tournera sur le strix halo via colibri :jap:

n°46255
the_fennec
f3nn3cUs z3rd4
Posté le 25-08-2026 à 17:46:33  profilanswer
 

Qwen3.8-Flash-Next
https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next
 
https://i.imgur.com/iZcyel9.png
 
 [:wark0]
 


---------------
Faudra que je teste un jour :o
n°46256
neo world
Posté le 25-08-2026 à 17:48:41  profilanswer
 

On sait quelle taille il doit faire ? :D

n°46258
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 25-08-2026 à 17:58:30  profilanswer
 

125B pour 6B actif apparemment, ça risque d'être gros  :sweat:

 


---------------
Victime de girafophobie, mais se soigne.
n°46259
the_fennec
f3nn3cUs z3rd4
Posté le 25-08-2026 à 18:00:04  profilanswer
 

Tronklou a écrit :

125B pour 6B actif apparemment, ça risque d'être gros  :sweat:


 
proof?
 
https://www.reddit.com/r/unsloth/co [...] t/p5sd39h/
 
[quote] Hey guys, Qwen announced Qwen3.8-Flash-Next, a new open-weight multimodal MoE model.

Message cité 1 fois
Message édité par the_fennec le 25-08-2026 à 18:00:14

---------------
Faudra que je teste un jour :o
n°46260
neo world
Posté le 25-08-2026 à 18:03:09  profilanswer
 

Tronklou a écrit :

125B pour 6B actif apparemment, ça risque d'être gros  :sweat:  
 


 [:billy-bob jambonbeur]

n°46261
the_fennec
f3nn3cUs z3rd4
Posté le 25-08-2026 à 18:04:22  profilanswer
 

Quelques infos ici, trouvé en random search:
https://www.explainx.ai/blog/qwen3- [...] ugust-2026


---------------
Faudra que je teste un jour :o
n°46262
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 25-08-2026 à 18:06:18  profilanswer
 

the_fennec a écrit :


 
proof?
 
https://www.reddit.com/r/unsloth/co [...] t/p5sd39h/
 
[quote] Hey guys, Qwen announced Qwen3.8-Flash-Next, a new open-weight multimodal MoE model.


 
https://x.com/aijoey/status/2092208673627996500?s=20


---------------
Victime de girafophobie, mais se soigne.
n°46263
the_fennec
f3nn3cUs z3rd4
Posté le 25-08-2026 à 18:09:40  profilanswer
 

https://www.reddit.com/r/LocalLLaMA [...] are_button
https://i.imgur.com/8y8CYvs.png
 
https://xcancel.com/AiBattle_/statu [...] 58460819#m
https://i.imgur.com/4k5MxnH.png
 
Il y aurait des info sur Hackernews aussi: https://news.ycombinator.com/item?id=49432317

Message cité 1 fois
Message édité par the_fennec le 25-08-2026 à 18:13:41

---------------
Faudra que je teste un jour :o
n°46265
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 25-08-2026 à 18:16:36  profilanswer
 

Finalement un strix halo c'est pas déconnant :O


---------------
Victime de girafophobie, mais se soigne.
n°46266
Olivie
SUUUUUUUUUUUUUU
Posté le 25-08-2026 à 18:32:17  profilanswer
 

Nouvelle puce M6 et M5 Ultra chez Apple annoncés aujourd'hui, ca veut concurrencer Nvidia :o

 

https://pbs.twimg.com/media/HQlCS6EbQAALEUT?format=jpg&name=small

Message cité 1 fois
Message édité par Olivie le 25-08-2026 à 18:32:27

---------------

n°46267
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 25-08-2026 à 18:33:14  profilanswer
 

La comparaison est drôle mais c'est tellement pas le même publique entre les deux :D


---------------
Victime de girafophobie, mais se soigne.
n°46269
moyen_moin​s
chat réincarné
Posté le 25-08-2026 à 18:36:26  profilanswer
 

punaise, faut trouver de la VRAM :fou:²²²²²²
un strix halo, c'est peut être pas si mal finalement :o

n°46271
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 25-08-2026 à 18:43:19  profilanswer
 

Mais ca reste lent :O
 
https://i.imgur.com/G3dyiZB.png


---------------
Victime de girafophobie, mais se soigne.
n°46272
moyen_moin​s
chat réincarné
Posté le 25-08-2026 à 18:45:59  profilanswer
 

Faut prendre les quants dédiés strix halo (rocmfpx) :o

n°46273
neo world
Posté le 25-08-2026 à 18:55:28  profilanswer
 


Le MoU en BF16  [:luc@s]  
 
Ça fait du 40+ tokens par seconde en q4 ou q6 :D
 
J’avions pas lu jusqu’au bout. C’est très utilisable ! Mais si vous avez 5k chez Apple M5 max c’est bien aussi sinon :o


Message édité par neo world le 25-08-2026 à 18:56:26
n°46274
moyen_moin​s
chat réincarné
Posté le 25-08-2026 à 19:12:06  profilanswer
 
n°46275
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 25-08-2026 à 19:27:09  profilanswer
 

Ca date de hier, y a prescription :O
 
Par contre en vrai je veut bien un retour de neo wrold :D


---------------
Victime de girafophobie, mais se soigne.
n°46276
moyen_moin​s
chat réincarné
Posté le 25-08-2026 à 19:31:54  profilanswer
 

j'ai vu sur alibaba des ascend avec 48Go de RAM ou plus en double puce je crois.
llama.cpp surpporte cette archi non ? :whistle:

n°46277
lapin
Posté le 25-08-2026 à 19:57:10  profilanswer
 

moyen_moins a écrit :

j'ai vu sur alibaba des ascend avec 48Go de RAM ou plus en double puce je crois.
llama.cpp surpporte cette archi non ? :whistle:


 
 
s'ils sont compatibles Vulkan à priori oui.

n°46278
neo world
Posté le 25-08-2026 à 19:58:13  profilanswer
 

Tronklou a écrit :

Finalement un strix halo c'est pas déconnant :O


une fois tous les 2 ans c'est le best deal possible. faut être patient  :lol:

n°46279
neo world
Posté le 25-08-2026 à 20:00:03  profilanswer
 

Tronklou a écrit :

Ca date de hier, y a prescription :O
 
Par contre en vrai je veut bien un retour de neo wrold :D


neo world il galère sur ses reverse proxy en face de nextcloud (dont talk est la fondation pour la communication entre agents)
 
la prochaine fois il prend mattermost installé en 10 minutes chrono :o

n°46280
Pipould's
Posté le 25-08-2026 à 20:32:41  profilanswer
 

moyen_moins a écrit :

Faut prendre les quants dédiés strix halo (rocmfpx) :o

 

Tiens... J'ai teste ca sur mon strix... claude code m'a sorti plein d'erreurs :-(

 

https://huggingface.co/julianmb/Qwe [...] -FAST-GGUF une vraie merde. J'ai jamais rien reussi a en faire. T'actives le mtp, le cache est invalide...

Message cité 1 fois
Message édité par Pipould's le 25-08-2026 à 21:07:27
n°46282
the_fennec
f3nn3cUs z3rd4
Posté le 25-08-2026 à 21:34:21  profilanswer
 

moyen_moins a écrit :

j'ai vu sur alibaba des ascend avec 48Go de RAM ou plus en double puce je crois.
llama.cpp surpporte cette archi non ? :whistle:


 
Combien?
 
"Supporte" oui, mais ça n'a pas l'air top. Ya un VLLM-ascend.
La double puce c'est la 96GB. Attention c'est un NPU avec de la LPDDR4!
https://www.reddit.com/r/LocalLLM/c [...] en_huawei/
 

lapin a écrit :

s'ils sont compatibles Vulkan à priori oui.


 
Non, ils sont pas, c'est CANN:
https://github.com/ggml-org/llama.c [...] nd/CANN.md


Message édité par the_fennec le 25-08-2026 à 21:35:06

---------------
Faudra que je teste un jour :o
n°46283
the_fennec
f3nn3cUs z3rd4
Posté le 25-08-2026 à 21:37:04  profilanswer
 

Olivie a écrit :

Nouvelle puce M6 et M5 Ultra chez Apple annoncés aujourd'hui, ca veut concurrencer Nvidia :o
 
https://pbs.twimg.com/media/HQlCS6E [...] name=small


 
T'es a la bourre d'une page...
Rien a voir en terme de tg/s et pp, chaque outil son utilisation.


---------------
Faudra que je teste un jour :o
n°46284
Fredouye
Shivers !
Posté le 25-08-2026 à 21:43:11  profilanswer
 

https://www.apple.com/newsroom/2026 [...] -m5-ultra/
 
Jusqu'à 512 Go de mémoire unifiée, 1.2 To de bande passante.
 
En 256 Go de RAM :

  • 9.500$ pour 30 coeurs CPU / 64 coeurs GPU
  • 10.800$ pour 36 coeurs CPU / 80 coeurs GPU


La version 512 Go sera dispo en octobre.


---------------
Le dernier arrivé est fan de Phil Collins
n°46285
Plam
Bear Metal
Posté le 25-08-2026 à 21:47:01  profilanswer
 

Tronklou a écrit :

125B pour 6B actif apparemment, ça risque d'être gros  :sweat:  
 


 
Hmm ça redonne de l'intéret à un DGX SPARK (ou les derniers Mac)


---------------
Spécialiste du bear metal
n°46286
the_fennec
f3nn3cUs z3rd4
Posté le 25-08-2026 à 21:50:48  profilanswer
 

Fredouye a écrit :

https://www.apple.com/newsroom/2026 [...] -m5-ultra/
 
Jusqu'à 512 Go de mémoire unifiée, 1.2 To de bande passante.
 
En 256 Go de RAM :

  • 9.500$ pour 30 coeurs CPU / 64 coeurs GPU
  • 10.800$ pour 36 coeurs CPU / 80 coeurs GPU


La version 512 Go sera dispo en octobre.


 
déjà posté 2x


---------------
Faudra que je teste un jour :o
n°46287
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 25-08-2026 à 21:53:04  profilanswer
 

Plam a écrit :

 

Hmm ça redonne de l'intéret à un DGX SPARK (ou les derniers Mac)

 

Après pour du MoE on peut encore tenter de choper de la ram et un gpu pour beaucoup moins cher que le mac


---------------
Victime de girafophobie, mais se soigne.
n°46288
moyen_moin​s
chat réincarné
Posté le 25-08-2026 à 21:53:46  profilanswer
 

Pipould's a écrit :


 
Tiens... J'ai teste ca sur mon strix... claude code m'a sorti plein d'erreurs :-(  
 
https://huggingface.co/julianmb/Qwe [...] -FAST-GGUF une vraie merde. J'ai jamais rien reussi a en faire. T'actives le mtp, le cache est invalide...


j'ai vu qu'il y avait plein de quant possible, les Q4 sont a priori OK, les Q6 c'est en cours.
je crois qu'il faut un fork de llama.cpp no n?

n°46289
Pipould's
Posté le 25-08-2026 à 21:55:32  profilanswer
 

moyen_moins a écrit :


j'ai vu qu'il y avait plein de quant possible, les Q4 sont a priori OK, les Q6 c'est en cours.
je crois qu'il faut un fork de llama.cpp no n?

 

Oui...

 

Le problème des systèmes unified c'est le prompt processing. Si tu reprends une session t'attends 3 ans...

n°46291
Plam
Bear Metal
Posté le 25-08-2026 à 22:03:09  profilanswer
 

Tronklou a écrit :

 

Après pour du MoE on peut encore tenter de choper de la ram et un gpu pour beaucoup moins cher que le mac

 

Bah perso je fais surtout pour des accès concurrents (pour ~20/50 personnes), un modèle MoE c'est une vraie opportunité d'avoir un contexte plus massif et de garder une vitesse de décodage sympa, même sur de la mémoire unifiée.


Message édité par Plam le 25-08-2026 à 22:03:25

---------------
Spécialiste du bear metal
n°46297
neo world
Posté le 25-08-2026 à 23:11:15  profilanswer
 


Pour 1/9 du coût d'entrainement de 3.7 plus ils arrivent à de meilleurs résultats ... ca va être l'explosition des modèles open si c'est reproduisible. On en aura partout

n°46298
moyen_moin​s
chat réincarné
Posté le 25-08-2026 à 23:37:23  profilanswer
 

C'est là que je vais regretter de pas avoir craqué pour 64Go de ddr4 cet été.
Punaise ce dilemme en ce moment  :sweat:

n°46299
neo world
Posté le 25-08-2026 à 23:46:25  profilanswer
 

https://www.generation-nt.com/actua [...] nt-2080131
 
Que quelqu’un me rappelle pourquoi braquer une banque est trop idiot :o

n°46300
chris282
id steam/psn : chris282_fr
Posté le 26-08-2026 à 00:01:39  profilanswer
 
n°46301
the_fennec
f3nn3cUs z3rd4
Posté le 26-08-2026 à 00:05:51  profilanswer
 

neo world a écrit :

https://www.generation-nt.com/actua [...] nt-2080131
 
Que quelqu’un me rappelle pourquoi braquer une banque est trop idiot :o


 
160GB de DDR6 :love:  
Manque que le prix, vu comment c'est partis, en 2027 on va être sur 50K euros :o


---------------
Faudra que je teste un jour :o
n°46302
the_fennec
f3nn3cUs z3rd4
Posté le 26-08-2026 à 00:16:30  profilanswer
 


Bienvenue :D


---------------
Faudra que je teste un jour :o
n°46303
the_fennec
f3nn3cUs z3rd4
Posté le 26-08-2026 à 00:17:50  profilanswer
 

35B-A3B tool calling benchmark: Original Qwen vs. KAT Coder, Ornith and Tiel-Coder
https://www.reddit.com/r/LocalLLaMA [...] l_qwen_vs/
 
Intéressant de voir des fine-tune de 35B faire mieux que 27B 3.6, mais en dessous de 3.8 ce qui est logique.
Je vais peut être tester un jour en fait :o

Spoiler :

mais pas demain

Message cité 1 fois
Message édité par the_fennec le 26-08-2026 à 00:18:03

---------------
Faudra que je teste un jour :o
n°46304
XprtZ
Profil : O.O
Posté le 26-08-2026 à 00:20:11  profilanswer
 

Fredouye a écrit :

https://www.apple.com/newsroom/2026 [...] -m5-ultra/
 
Jusqu'à 512 Go de mémoire unifiée, 1.2 To de bande passante.
 
En 256 Go de RAM :

  • 9.500$ pour 30 coeurs CPU / 64 coeurs GPU
  • 10.800$ pour 36 coeurs CPU / 80 coeurs GPU


La version 512 Go sera dispo en octobre.


 
12K€ et quasi le double pour 512go  [:galom]
 
Qui achète ?  [:catalonix:10]


---------------
PSN : XprtZ - BattleTag : XprtZ#2257 - 3DS : 2492-4109-3060
n°46305
extenue1
Posté le 26-08-2026 à 01:23:44  profilanswer
 

 

Merci , on peut esperer faire tourner quoi correctement a ton avis avec le Mini M6 32 GB ?

 Page :   1  2  3  4  5  ..  44  45  46  ..  59  60  61  62  63  64

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)