Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
3488 connectés 

 


Je génère ...
Sondage à 3 choix possibles.
Ce sondage expirera le 20-09-2026 à 10:00




Attention si vous cliquez sur "voir les résultats" vous ne pourrez plus voter

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  48  49  50  ..  56  57  58  59  60  61
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°46545
neo world
Posté le 27-08-2026 à 16:17:23  profilanswer
 

Reprise du message précédent :

neo world a écrit :


Qwen3.8 27b Q4 via lemonade, iommu=pt (pour accès au NPU) et vulkan. Le tout téléchargé depuis les repos classiques. Rien de tweaké à part iommu et profil perf dans linux


P'tite opti sur llama.cpp (from https://sleepingrobots.com/dreams/q [...] trix-halo/ ) :
    -fa on -ngl 999 -b 2048 -ub 2048 --cache-reuse 1 --no-mmap
    --spec-type draft-mtp --spec-draft-n-max 2
    -np 1 --ctx-size 131072
    --cache-type-k q8_0 --cache-type-v q8_0
    --no-context-shift
    --jinja --chat-template-file ~/llama-swap/templates/chat_template.jinja
    --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0
    --presence-penalty 0.0 --repeat-penalty 1.0
    --chat-template-kwargs "{\"preserve_thinking\":true}"
 
26 tokens / seconde  [:protect_me:5]  
 
https://rehost.diberie.com/Picture/Get/f/539177


Message édité par neo world le 27-08-2026 à 16:29:45
n°46548
the_fennec
f3nn3cUs z3rd4
Posté le 27-08-2026 à 16:28:23  profilanswer
 

Il me semble que preserve_thinking est actif par défaut dans Qwen 3.8. Pour no-context-shift c'est on par défaut dans llama.cpp.
 
Par contre "-b 2048 -ub 2048" j'ai toujours du mal a comprendre l'effet precis dans mon cas. Ça bouffe plein de VRAM, mais ça va un peu plus vite.


---------------
Faudra que je teste un jour :o
n°46549
neo world
Posté le 27-08-2026 à 16:42:44  profilanswer
 

ça joue sur la taille des batch (j'imagine combien de jobs en parallèle) logiquement plus le chiffre est gros plus ça consommera pour tout ce qui est utilisé à l'instant T dans les registres (valeurs du token en cours de création). Trop gros pas assez d'ALU (donc queue d'attente) et conso de VRAM plus importante
 
C'était une explication par l'académie du doigt mouillé quand elle faisait encore du HPC y'a, pfiou, trop longtemps :o

n°46550
neo world
Posté le 27-08-2026 à 17:07:21  profilanswer
 

Pour info avec le Q6_k j'arrive à 24,8TPS.  [:implosion du tibia]

n°46551
the_fennec
f3nn3cUs z3rd4
Posté le 27-08-2026 à 17:43:44  profilanswer
 

T'es sur ton Strix non?
Pourquoi tu prends pas du Q8_XL?


---------------
Faudra que je teste un jour :o
n°46552
neo world
Posté le 27-08-2026 à 17:56:55  profilanswer
 

the_fennec a écrit :

T'es sur ton Strix non?
Pourquoi tu prends pas du Q8_XL?


pour quelques pouillèmes de précision en plus je vais perdre encore des tokens / seconde. Je vais là où me guide la foule :o
 
En vrai c'est que des benchmarks sur un coin de table. La j'ai commandé un ventilo et des dissipateurs pour les NVME (un surchauffe franchement), j'ai encore du taffe sur la partie WAF du système de communication (nextcloud talk), le chiffrement en https des call API vers lemonade et après j'installe enfin un harness dans cette infra. 6 mois après tout le monde oui :o

n°46553
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 27-08-2026 à 18:08:47  profilanswer
 

Dans le cas des Strix Halo, le truc à surveiller c'est surtout le support de FreeToken avec les GPU AMD.
Là, ça sera la fête du slip en mettant (au hasard :D) une 5070 Ti en OCuLink.
Comme ça on pourrait faire exploser la vitesse de prefill, qui est justement le gros point faible du Strix, tout en gardant son immense RAM partagée.


---------------
Victime de girafophobie, mais se soigne.
n°46558
neo world
Posté le 27-08-2026 à 18:26:10  profilanswer
 

J’ai assez de plaques chauffantes au sous-sol mais c’est gentil de penser aux longues nuits d’hiver  [:henry-death:3] :o


Message édité par neo world le 27-08-2026 à 18:31:15
n°46562
the_fennec
f3nn3cUs z3rd4
Posté le 27-08-2026 à 19:01:08  profilanswer
 

Benchmarking Qwen3.8 27B quantizations: 4-bit holds up, 1-bit collapses
https://quesma.com/blog/qwen38-27b- [...] nchmarked/
 
TL;DR
 
https://i.imgur.com/dqSOr6j.png
 
Je vais tester Q4_K_M pour voir.


---------------
Faudra que je teste un jour :o
n°46563
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 27-08-2026 à 19:02:32  profilanswer
 

Le Q4, meilleur compromis comme d'hab :D


---------------
Victime de girafophobie, mais se soigne.
n°46582
the_fennec
f3nn3cUs z3rd4
Posté le 27-08-2026 à 21:47:52  profilanswer
 

J'ai mis Q4_K_XL en test pour voir!
 
Sinon le support de Qwen Next vient d'être mergé:
https://github.com/ggml-org/llama.cpp/pull/27742
 
Je suis un feignasse dons j'attends les builds :o


---------------
Faudra que je teste un jour :o
n°46589
neo world
Posté le 27-08-2026 à 22:03:23  profilanswer
 

https://youtu.be/Idoif7BzZbg
 
Pour chaque setup il y a sa version overkill sur YouTube :o

n°46593
the_fennec
f3nn3cUs z3rd4
Posté le 27-08-2026 à 22:20:44  profilanswer
 

neo world a écrit :

https://youtu.be/Idoif7BzZbg
 
Pour chaque setup il y a sa version overkill sur YouTube :o


 
Vu hier, il a trop de sous/sponsors ce gars :o


---------------
Faudra que je teste un jour :o
n°46595
neo world
Posté le 27-08-2026 à 22:44:41  profilanswer
 

Ouvrir une chaine sur le hardware IA pour les dev avant 2025 et devenir riche en 2026 :o

n°46598
the_fennec
f3nn3cUs z3rd4
Posté le 27-08-2026 à 23:24:10  profilanswer
 

Build llama.cpp pour Qwen3.8 Flash Next dispo!

Message cité 1 fois
Message édité par the_fennec le 27-08-2026 à 23:57:17

---------------
Faudra que je teste un jour :o
n°46600
neo world
Posté le 27-08-2026 à 23:42:11  profilanswer
 

the_fennec a écrit :

Build llama.cpp pour Qwen3.8 dispo!


Ca ajoute quoi ? :D

n°46601
the_fennec
f3nn3cUs z3rd4
Posté le 28-08-2026 à 00:01:35  profilanswer
 

neo world a écrit :


Ca ajoute quoi ? :D


 
edit :o
 
J'ai réussi a charger Qwen3.8-Flash-Next-UD-IQ1_S  :love:  
 

Code :
  1. llama-server --flash-attn on -lv 4 --load-mode none --metrics --alias default --host 0.0.0.0 --port 8080  -m X:\dev\models\Qwen3.8-Flash-Next-UD-IQ1_S-00001-of-00003.gguf --rpc lain:50000,arisu:50000 -ngl 45 -ts 14,14,15 --n-cpu-moe 4 --tensor-read-lazy on --ctx-size 16384 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0   --jinja -ctk q4_0 -ctv q4_0


 

Citation :


0.03.936.063 I load_tensors: offloading 44 repeating layers to GPU
0.03.936.064 I load_tensors: offloaded 45/49 layers to GPU
0.03.936.071 I load_tensors: RPC0[arisu:50000] model buffer size = 12667.88 MiB
0.03.936.073 I load_tensors: RPC0[lain:50000] model buffer size = 12673.00 MiB
0.03.936.075 I load_tensors:      Vulkan0 model buffer size = 12489.69 MiB
0.03.936.076 I load_tensors:  Vulkan_Host model buffer size = 31344.62 MiB
...
8.47.340.737 I slot print_timing: id  3 | task 84 | n_gen =    100, tg =   9.89 t/s, tg_3s =   9.99 t/s
8.50.398.975 I slot print_timing: id  3 | task 84 | n_gen =    131, tg =   9.95 t/s, tg_3s =  10.14 t/s
8.53.409.507 I slot print_timing: id  3 | task 84 | n_gen =    161, tg =   9.95 t/s, tg_3s =   9.97 t/s
8.56.424.859 I slot print_timing: id  3 | task 84 | n_gen =    190, tg =   9.90 t/s, tg_3s =   9.62 t/s
8.59.429.331 I slot print_timing: id  3 | task 84 | n_gen =    222, tg =  10.00 t/s, tg_3s =  10.65 t/s
9.02.521.779 I slot print_timing: id  3 | task 84 | n_gen =    254, tg =  10.04 t/s, tg_3s =  10.35 t/s
9.05.563.692 I slot print_timing: id  3 | task 84 | n_gen =    283, tg =   9.99 t/s, tg_3s =   9.53 t/s
9.07.294.038 E recv failed (bytes_recv=0, size_to_recv=8)
D:/a/llama.cpp/llama.cpp/ggml/src/ggml-rpc/ggml-rpc.cpp:566: Remote RPC server crashed or returned malformed response


 
Bon ça crash avant de finir mon flappy bird, mais 10 tg/s c'est aussi bien que 27B!


---------------
Faudra que je teste un jour :o
n°46602
the_fennec
f3nn3cUs z3rd4
Posté le 28-08-2026 à 00:16:21  profilanswer
 

With HuggingFace, Nvidia is also acquiring llama.cpp and the team behind it
https://www.reddit.com/r/LocalLLaMA [...] acquiring/
 

Citation :

With this move Nvidia is not only acquiring the HuggingFace platform, but they might also effectively acquire the copyright to the llama.cpp project, together with the entire team behind it.
 
In February 2026 the llama.cpp team was employed by HF in order to continue working on llama.cpp and the ggml library.
...
 
Now with the acquisition, llama.cpp's future looks a lot less certain given Nvidia's poor track record with open-source.


 
euuuh  :( d4fuk?


---------------
Faudra que je teste un jour :o
n°46603
neo world
Posté le 28-08-2026 à 00:20:38  profilanswer
 

the_fennec a écrit :

With HuggingFace, Nvidia is also acquiring llama.cpp and the team behind it
https://www.reddit.com/r/LocalLLaMA [...] acquiring/
 

Citation :

With this move Nvidia is not only acquiring the HuggingFace platform, but they might also effectively acquire the copyright to the llama.cpp project, together with the entire team behind it.
 
In February 2026 the llama.cpp team was employed by HF in order to continue working on llama.cpp and the ggml library.
...
 
Now with the acquisition, llama.cpp's future looks a lot less certain given Nvidia's poor track record with open-source.


 
euuuh  :( d4fuk?


Nvidia c’est pas les pires en soft. Limite je préfère que ce ne soit pas AMD :o
 
Perso je pense que ça ne changera rien. Si les chinois sont obligés de réécrire le moteur pour bosser on pourrait avoir une très bonne surprise et peut être voir arriver plus de matos en occident façon la Mi ai box

n°46604
AllenMadis​on
Oracle du Keb's
Posté le 28-08-2026 à 02:41:51  profilanswer
 

the_fennec a écrit :


 
Vu hier, il a trop de sous/sponsors ce gars :o


 
Lui et digital spaceport, ils me font baver à chaque fois  [:cerveau nico54]


---------------
Nothing much to teach, man. There's ze high, there's ze low and yall still fucking miss.
n°46608
the_fennec
f3nn3cUs z3rd4
Posté le 28-08-2026 à 08:43:53  profilanswer
 

neo world a écrit :


Nvidia c’est pas les pires en soft. Limite je préfère que ce ne soit pas AMD :o
 
Perso je pense que ça ne changera rien. Si les chinois sont obligés de réécrire le moteur pour bosser on pourrait avoir une très bonne surprise et peut être voir arriver plus de matos en occident façon la Mi ai box


 
J'espère aussi qu'au pire ça changera rien, mais on pourrait espérer qu'avec tout son pognon NV mette plus de gens dessus :love:


---------------
Faudra que je teste un jour :o
n°46609
neo world
Posté le 28-08-2026 à 08:57:46  profilanswer
 

the_fennec a écrit :


 
J'espère aussi qu'au pire ça changera rien, mais on pourrait espérer qu'avec tout son pognon NV mette plus de gens dessus :love:


 
Ca me semble évident oui mais avec une grosse priorité sur ce qui différencie CUDA de Metal ou Rocm
 
Après un ou deux ingés Nvidia sur le moteur autour de Rocm feraient probablement des miracles mais je sais pas si ils sortiraient le résultat de leur lab dans ces conditions  :whistle:

n°46610
Nr13
Posté le 28-08-2026 à 09:05:32  profilanswer
 

neo world a écrit :


Nvidia c’est pas les pires en soft. Limite je préfère que ce ne soit pas AMD :o
 
Perso je pense que ça ne changera rien. Si les chinois sont obligés de réécrire le moteur pour bosser on pourrait avoir une très bonne surprise et peut être voir arriver plus de matos en occident façon la Mi ai box


 
Historiquement NVidia c'est la catastrophe en terme de verrouillage de licence et cie non? cf le bordel avec les kernels linux et cie..

n°46612
neo world
Posté le 28-08-2026 à 09:14:26  profilanswer
 

historiquement ils sont bons en soft et mauvais en partage/OSS mais là les constructeurs et developpeurs chinois attendent le premier faux pas pour rentrer en grand et imposer leur écosystème en lieu et place de l'actuel . Je pense que Nvidia va intégrer plus rapidement ses technos dans llama sans gêner le reste de la roadmap (sans trop trop prioriser le debug de trucs comme la mi box AI mais ça forkera dans cas)

n°46613
moyen_moin​s
chat réincarné
Posté le 28-08-2026 à 09:26:54  profilanswer
 

the_fennec a écrit :

With HuggingFace, Nvidia is also acquiring llama.cpp and the team behind it
https://www.reddit.com/r/LocalLLaMA [...] acquiring/
 

Citation :

With this move Nvidia is not only acquiring the HuggingFace platform, but they might also effectively acquire the copyright to the llama.cpp project, together with the entire team behind it.
 
In February 2026 the llama.cpp team was employed by HF in order to continue working on llama.cpp and the ggml library.
...
 
Now with the acquisition, llama.cpp's future looks a lot less certain given Nvidia's poor track record with open-source.


 
euuuh  :( d4fuk?


super.
j'espère qu'il y aura un fork :spamafote:

n°46615
moyen_moin​s
chat réincarné
Posté le 28-08-2026 à 09:38:54  profilanswer
 

Impossible de faire fonctionner les UD3 d'unsloth sur ma config :heink:

Citation :


qwen3.8-27b
Processing Prompt... 99%
 
This message contains no content. The AI has nothing to say.


ce coup ci en Q4_K_XL (et pas Q6).
MTP ON ou OFF, même combat.
mmap désactivé, vulkan.
[:paysan]

n°46616
the_fennec
f3nn3cUs z3rd4
Posté le 28-08-2026 à 09:47:42  profilanswer
 

moyen_moins a écrit :


super.
j'espère qu'il y aura un fork :spamafote:


 
il y en a déjà plein, le problème c'est que le gros du taf est fait par 3/4 personnes qui sont des employés de HF.
 

moyen_moins a écrit :

Impossible de faire fonctionner les UD3 d'unsloth sur ma config :heink:

Citation :


qwen3.8-27b
Processing Prompt... 99%
 
This message contains no content. The AI has nothing to say.


ce coup ci en Q4_K_XL (et pas Q6).
MTP ON ou OFF, même combat.
mmap désactivé, vulkan.
[:paysan]


 
Quelle version de llama.cpp? :o


---------------
Faudra que je teste un jour :o
n°46617
the_fennec
f3nn3cUs z3rd4
Posté le 28-08-2026 à 09:51:49  profilanswer
 

the_fennec a écrit :

J'ai mis Q4_K_XL en test pour voir!


 
Bon ben comme je m'y attendais, pas de gros gain en passant de Q8 a Q4 sur Qwen 3.8 27B. Rien en PP, le TGS passe de 6 a 8, mais ça change pas grand-chose au final.


---------------
Faudra que je teste un jour :o
n°46618
Nr13
Posté le 28-08-2026 à 09:57:58  profilanswer
 

neo world a écrit :

historiquement ils sont bons en soft et mauvais en partage/OSS mais là les constructeurs et developpeurs chinois attendent le premier faux pas pour rentrer en grand et imposer leur écosystème en lieu et place de l'actuel . Je pense que Nvidia va intégrer plus rapidement ses technos dans llama sans gêner le reste de la roadmap (sans trop trop prioriser le debug de trucs comme la mi box AI mais ça forkera dans cas)


 
Ha oui ils sont très bons techniquement depuis le début mais horrible en partage/verrouillage etc (depuis le début aussi à peu près lol). A moins d'un changement de stratégie (plus que gagnante on peut le dire), c'est pas une bonne nouvelle pour les concurrents ou même les simples adeptes de l'ouverture qui utilisent les solutions que NVidia rachète...


Message édité par Nr13 le 28-08-2026 à 09:58:31
n°46621
neo world
Posté le 28-08-2026 à 10:08:59  profilanswer
 

pas forcément, repartir sur des bases saines de forks avec des optimisations plus profondes pour des machines comme le strix halo, le mi, MLX etc. n'est pas forcément une mauvaise nouvelle. llama est super mais je n'ose imaginer toutes les optimisations encore à faire si la route actuelle pousse des devs et des entreprises à revoir les fondations. Vu le traitement de la Chine par les US/Nvidia ils vont aussi commencer à envisager des plans de sortie. Jusque là ça a toujours payé pour eux de sortir de l'écosystème existant pour développer le leur (android huawey, licences ARM, Marché de cartes d'acceleration artificiellement limité par le gouv US ...)


Message édité par neo world le 28-08-2026 à 10:09:33
n°46622
Nr13
Posté le 28-08-2026 à 10:26:38  profilanswer
 

Ha oui c'est une possibilité, mais on est d'accord que c'est en mode "NVidia va tuer le projet pour tous les autres, le point positif c'est que ça va forcer d'autres acteurs à y consacrer des ressources" :o

n°46623
neo world
Posté le 28-08-2026 à 10:35:30  profilanswer
 

Nr13 a écrit :

Ha oui c'est une possibilité, mais on est d'accord que c'est en mode "NVidia va tuer le projet pour tous les autres, le point positif c'est que ça va forcer d'autres acteurs à y consacrer des ressources" :o


C'est un des outcome possible. Un autre serait que la team démissionne et démarre leur propre structure ou que tout simplement Nvidia leur fiche la paix en leur donnant des élements de roadmap plus tôt pour qu'ils intégrent rapidement les nouveautés cuda.  [:michaeldell:2] :o

n°46627
speedboyz3​0
Guide Michelin :o
Posté le 28-08-2026 à 11:17:03  profilanswer
 

On en est où du RTX Spark au fait ? :o

n°46629
neo world
Posté le 28-08-2026 à 11:27:36  profilanswer
 

ça suit son cours :
https://www.blog-nouvelles-technolo [...] -portable/
 
Tu es parti pour préférer cette plateforme ? Tu sais que le CPU n'est pas X86 mais ARM ?

n°46630
speedboyz3​0
Guide Michelin :o
Posté le 28-08-2026 à 11:30:12  profilanswer
 

Je girouettise toujours sur le Mac Studio.  
Du coup je considère tout :jap:

n°46631
neo world
Posté le 28-08-2026 à 11:37:02  profilanswer
 

speedboyz30 a écrit :

Je girouettise toujours sur le Mac Studio.  
Du coup je considère tout :jap:


si je devais choisir pour toi :
=> Asus pro art Strix halo si tu veux du microsoft / linux (le bordel Nvidia sera probablement très bien mais sans X86 ta machine sera franchement diminuée pour du workstation même si l'emulation sauvera un peu les meubles (coeurs ARM qui commencent à être franchement anciens côté Nvidia)
=> Macbook pro 16" si tu veux du portable avec une autonomie ridiculement longue et de la puissance à revendre
=> Mac Studio si tu veux une machine à tout faire économe en energie et rapide
=> BosgamePC si 128GB de ram est un must pour toi mais au delà de 2500 balles c'est compliqué à justifier
 
Sur strix halo il commence à y avoir des optimisations et des tuto pour Qwen 3.8 flash :
https://www.soothill.io/blog/2026/0 [...] trix-halo/
 
Je m'attends à ce que ça bouge bien sur les prochains jours. J'attends mes ventilo pour les NVME avant de me lancer à mon tour :jap:

Message cité 1 fois
Message édité par neo world le 28-08-2026 à 11:38:10
n°46637
moyen_moin​s
chat réincarné
Posté le 28-08-2026 à 14:05:21  profilanswer
 

the_fennec a écrit :


 
Quelle version de llama.cpp? :o


La dernière de LM Studio :o
J'ai testé en speed ce matin avant d'aller bosser.
Je vais essayer en changeant le template jinja en rentrant.

n°46639
lapin
Posté le 28-08-2026 à 14:09:32  profilanswer
 

moyen_moins a écrit :


La dernière de LM Studio :o
J'ai testé en speed ce matin avant d'aller bosser.
Je vais essayer en changeant le template jinja en rentrant.


 
 
Est-ce bien la Version V2.31.2 de Llama.cpp !!??
Que ce soit en CUDA qu'en VULKAN ou ROCm ou CPU Only!?

n°46640
moyen_moin​s
chat réincarné
Posté le 28-08-2026 à 14:21:01  profilanswer
 

J'ai essayé que Vulkan, j'ai pas de nvidia dans mon pc :o

n°46645
moyen_moin​s
chat réincarné
Posté le 28-08-2026 à 15:40:13  profilanswer
 

Bc-250 reçu, va falloir que j'installe tout ça ce weekend et que je regarde quel modèle je peux mettre la dessus :o
Trop de trucs à tester et le Z qui revient, j'espère qu'il fera moche ce weekend :o

n°46647
Pipould's
Posté le 28-08-2026 à 16:30:39  profilanswer
 

moyen_moins a écrit :

Bc-250 reçu, va falloir que j'installe tout ça ce weekend et que je regarde quel modèle je peux mettre la dessus :o
Trop de trucs à tester et le Z qui revient, j'espère qu'il fera moche ce weekend :o


Reçu moi aussi , mais en France chez mes parents, du coup ça va prendre plus de temps ^^

 Page :   1  2  3  4  5  ..  48  49  50  ..  56  57  58  59  60  61

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)