Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
4028 connectés 

 


Je génère ...
Sondage à 3 choix possibles.
Ce sondage expirera le 20-09-2026 à 10:00




Attention si vous cliquez sur "voir les résultats" vous ne pourrez plus voter

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  46  47  48  ..  59  60  61  62  63  64
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°46369
moyen_moin​s
chat réincarné
Posté le 26-08-2026 à 13:14:55  profilanswer
 

Reprise du message précédent :
Question pour les pros ou amateurs éclairés :)

 

Pour un projet avec pas mal de RAG et de l'analyse de texte avec raisonnement (no code), quelle version de qwen 3.8 il vaut mieux prendre sachant que je souhaite contexte max et que j'ai que 30Go de VRAM dispo environ ? :o
J'hésite entre UD_IQ4_XS chez unsloth ou du UD_Q4_K_XL mais il y a 3Go de diff et la taille du contexte est vraiment un critère important.
En Q6, j'arrive à gratter que 66k de contexte par exemple :/

Message cité 1 fois
Message édité par moyen_moins le 26-08-2026 à 13:15:35
n°46370
Pipould's
Posté le 26-08-2026 à 13:25:17  profilanswer
 

Amonchakai a écrit :

Ouais je suis d’accord, à 5000 tu as pas le budget pour bosser ou faut faire avec les solution cloud.

 

Et pour jouer, bah ouais pourquoi pas les spark et Apple

 

Bah si dual de 2080ti 22 she une cm rincee en ddr3 et t'as du Qwen 3.8 parfaitement utilisable.


Message édité par Pipould's le 26-08-2026 à 13:25:32
n°46373
neo world
Posté le 26-08-2026 à 13:32:58  profilanswer
 

je sens que le prix des 2080 ti vont s'envoler rapidement pour ceux qui hésitent et aimeraient vraiment en acheter n'attendez pas septembre pour vous décider :jap:

n°46375
moyen_moin​s
chat réincarné
Posté le 26-08-2026 à 13:39:04  profilanswer
 

neo world a écrit :

je sens que le prix des 2080 ti vont s'envoler rapidement pour ceux qui hésitent et aimeraient vraiment en acheter n'attendez pas septembre pour vous décider :jap:


Les modèles avec 22Go de VRAM ?
Ca perf comment une 2080 ?

n°46376
neo world
Posté le 26-08-2026 à 13:50:13  profilanswer
 

assez pour que ce soit une bonne alternative aux mac / strix et bidouille a base de BC250 montées à l'envers dans le sens du vent :o  
 
https://ai-muninn.com/en/blog/qwen3 [...] r-parallel

n°46377
croustx
Modoadorateur
Posté le 26-08-2026 à 14:12:08  profilanswer
 

200€ la 2080ti sur leboncoin.

 

pour 600€, tu en prends 3 et a une bête de course

 

Juste prévoir le NVLink  qui va coute aussi cher que la carte :o


Message édité par croustx le 26-08-2026 à 14:12:50
n°46378
the_fennec
f3nn3cUs z3rd4
Posté le 26-08-2026 à 14:15:33  profilanswer
 

Celles sur leboncoin ont que 11GB de VRAM, il faut les faire moder ensuite.


---------------
Faudra que je teste un jour :o
n°46379
croustx
Modoadorateur
Posté le 26-08-2026 à 14:21:23  profilanswer
 

the_fennec a écrit :

Celles sur leboncoin ont que 11GB de VRAM, il faut les faire moder ensuite.


 
Ba t'en prends 2x plus :o

n°46380
the_fennec
f3nn3cUs z3rd4
Posté le 26-08-2026 à 14:21:32  profilanswer
 

moyen_moins a écrit :

Question pour les pros ou amateurs éclairés :)
 
Pour un projet avec pas mal de RAG et de l'analyse de texte avec raisonnement (no code), quelle version de qwen 3.8 il vaut mieux prendre sachant que je souhaite contexte max et que j'ai que 30Go de VRAM dispo environ ? :o
J'hésite entre UD_IQ4_XS chez unsloth ou du UD_Q4_K_XL mais il y a 3Go de diff et la taille du contexte est vraiment un critère important.
En Q6, j'arrive à gratter que 66k de contexte par exemple :/


 
T'as combien de VRAM?
Tu gardes le MTP?
 
Difficile a dire sans bien connaître ton projet. Normalement un RAG sert a ne renvoyer que ce qui est important au lieu du doc complet pour préserver le contexte.
 
Il y a une belle diff entre les deux:
https://i.imgur.com/8cYCI3Z.png
 
https://unsloth.ai/docs/basics/dynamic-3.0-ggufs


---------------
Faudra que je teste un jour :o
n°46381
croustx
Modoadorateur
Posté le 26-08-2026 à 14:23:24  profilanswer
 

Sur leboncoin, il y a aussi pas mal de RIG de minage à vendre, à base de 10x 3060.
 
Ca peut etre une bonne solution aussi

n°46382
the_fennec
f3nn3cUs z3rd4
Posté le 26-08-2026 à 14:25:45  profilanswer
 

croustx a écrit :


 
Ba t'en prends 2x plus :o


 
Ce qui donne 400 euros pour 22GB sur LBC au lieu de 300 sur Alibaba.
Tu devrais demander a la pince de faire les calculs pour toi :o.


---------------
Faudra que je teste un jour :o
n°46383
moyen_moin​s
chat réincarné
Posté le 26-08-2026 à 14:29:20  profilanswer
 

the_fennec a écrit :

 

T'as combien de VRAM?
Tu gardes le MTP?

 

Difficile a dire sans bien connaître ton projet. Normalement un RAG sert a ne renvoyer que ce qui est important au lieu du doc complet pour préserver le contexte.

 

Il y a une belle diff entre les deux:
https://i.imgur.com/8cYCI3Z.png

 

https://unsloth.ai/docs/basics/dynamic-3.0-ggufs


32Go de VRAM mais on va dire 30 exploitables (c'est plus stable comme ça).
MTP pas obligatoire. Si présent tant mieux, sinon :spamafote:
Le RAG sera là pour l'accès aux doc applicables à mon projet (normes/standard etc.)

 

edit: sinon je coupe la poire en 2 et Q4_K_S [:paysan]

Message cité 1 fois
Message édité par moyen_moins le 26-08-2026 à 14:31:42
n°46384
croustx
Modoadorateur
Posté le 26-08-2026 à 14:30:37  profilanswer
 

the_fennec a écrit :


 
T'as combien de VRAM?
Tu gardes le MTP?
 
Difficile a dire sans bien connaître ton projet. Normalement un RAG sert a ne renvoyer que ce qui est important au lieu du doc complet pour préserver le contexte.
 
Il y a une belle diff entre les deux:
https://i.imgur.com/8cYCI3Z.png
 
https://unsloth.ai/docs/basics/dynamic-3.0-ggufs


 
 
Il y a des versions "Unsloth abliterated" ?

n°46385
the_fennec
f3nn3cUs z3rd4
Posté le 26-08-2026 à 14:31:07  profilanswer
 

croustx a écrit :

Sur leboncoin, il y a aussi pas mal de RIG de minage à vendre, à base de 10x 3060.
 
Ca peut etre une bonne solution aussi


 
Ya pas des rigs de 170hx apachère? :o
 


---------------
Faudra que je teste un jour :o
n°46387
the_fennec
f3nn3cUs z3rd4
Posté le 26-08-2026 à 14:34:24  profilanswer
 

moyen_moins a écrit :


32Go de VRAM mais on va dire 30 exploitables (c'est plus stable comme ça).
MTP pas obligatoire. Si présent tant mieux, sinon :spamafote:
Le RAG sera là pour l'accès aux doc applicables à mon projet (normes/standard etc.)
 
edit: sinon je coupe la poire en 2 et Q4_K_S [:paysan]


 
Avec 30GB tu mets large un Q6 avec ton kv cache en Q8 non ?


---------------
Faudra que je teste un jour :o
n°46388
the_fennec
f3nn3cUs z3rd4
Posté le 26-08-2026 à 14:35:29  profilanswer
 

croustx a écrit :

Il y a des versions "Unsloth abliterated" ?


 
Il le font pas eux-même, mais je pense que beaucoup de fine-tunes sont basés dessus ou Bartowski


---------------
Faudra que je teste un jour :o
n°46390
moyen_moin​s
chat réincarné
Posté le 26-08-2026 à 14:39:26  profilanswer
 

the_fennec a écrit :


 
Avec 30GB tu mets large un Q6 avec ton kv cache en Q8 non ?


niet, max kv cache avec le Q6 : ~66k
et q8/q5_1, tu gagnes peut être ~8-9% en plus
j'ai testé un 3.6 35B hier soir et sur les données synthétiques, le résultat était correct mais avec quelques trucs bizarres.
et y'avait pas masse info à aller chercher :/

n°46391
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 26-08-2026 à 14:43:33  profilanswer
 

croustx a écrit :

Sur leboncoin, il y a aussi pas mal de RIG de minage à vendre, à base de 10x 3060.
 
Ca peut etre une bonne solution aussi


 
Mais bien trop souvent c'est tout en pcie 1x, donc faut vraiment garder ca pour le prix unitaire de la cg et éventuellement l'alim.


---------------
Victime de girafophobie, mais se soigne.
n°46393
the_fennec
f3nn3cUs z3rd4
Posté le 26-08-2026 à 15:02:22  profilanswer
 

moyen_moins a écrit :


niet, max kv cache avec le Q6 : ~66k
et q8/q5_1, tu gagnes peut être ~8-9% en plus
j'ai testé un 3.6 35B hier soir et sur les données synthétiques, le résultat était correct mais avec quelques trucs bizarres.
et y'avait pas masse info à aller chercher :/


 
T'es sous Windows ou Linux?
Tu peux montrer ton utilisation VRAM?
 
Veux mieux garder le KV cache a Q8, de toute manière Qwen utilise massivement les keys, rogner sur les values sert a rien.
 
T'as testé 27B? 35B est beaucoup plus gros, surtout la 3.8 qui a bien fondu!


---------------
Faudra que je teste un jour :o
n°46394
moyen_moin​s
chat réincarné
Posté le 26-08-2026 à 15:27:10  profilanswer
 

toujours sous windows :/
justement, j'ai pas testé le 27B qui est beaucoup plus lourd et je me demandais si pour la qualité que je souhaite obtenir, valait pas moeux l'utiliser malgré tout mais avec un quant <Q6 pour gratter du contexte (le max)

n°46395
croustx
Modoadorateur
Posté le 26-08-2026 à 15:29:57  profilanswer
 

moyen_moins a écrit :

toujours sous windows :/
justement, j'ai pas testé le 27B qui est beaucoup plus lourd et je me demandais si pour la qualité que je souhaite obtenir, valait pas moeux l'utiliser malgré tout mais avec un quant <Q6 pour gratter du contexte (le max)


 
 
Sur linux en headless, j'ai Qwen 3.6 en 27b Q4.
150k de contexte.
 
Et ça passe nickel.

n°46396
the_fennec
f3nn3cUs z3rd4
Posté le 26-08-2026 à 15:42:51  profilanswer
 

moyen_moins a écrit :

toujours sous windows :/
justement, j'ai pas testé le 27B qui est beaucoup plus lourd et je me demandais si pour la qualité que je souhaite obtenir, valait pas moeux l'utiliser malgré tout mais avec un quant <Q6 pour gratter du contexte (le max)


 
Lourd? Tu veux dire lent?
Parce qu'il est beaucoup plus petit que 35B.


---------------
Faudra que je teste un jour :o
n°46397
the_fennec
f3nn3cUs z3rd4
Posté le 26-08-2026 à 15:44:19  profilanswer
 

[Megathread] Qwen3.8-Flash-Next - Release Day
https://www.reddit.com/r/LocalLLaMA [...] lease_day/
 
Pas mal d'info


---------------
Faudra que je teste un jour :o
n°46399
speedboyz3​0
Guide Michelin :o
Posté le 26-08-2026 à 16:06:13  profilanswer
 

croustx a écrit :


 
 
Sur linux en headless, j'ai Qwen 3.6 en 27b Q4.
150k de contexte.
 
Et ça passe nickel.


 
T'as quoi comme matos avec ça ?

n°46400
croustx
Modoadorateur
Posté le 26-08-2026 à 16:13:18  profilanswer
 

speedboyz30 a écrit :


 
T'as quoi comme matos avec ça ?


 
RTX3090 avec un vieux PC

n°46402
moyen_moin​s
chat réincarné
Posté le 26-08-2026 à 16:23:53  profilanswer
 

the_fennec a écrit :


 
Lourd? Tu veux dire lent?
Parce qu'il est beaucoup plus petit que 35B.


Lourd en pp et tg
J'ai facile 300-400t/s en pp et 30+ t/s en tg sans MTP avec le 35B en Q6

n°46403
moyen_moin​s
chat réincarné
Posté le 26-08-2026 à 16:26:32  profilanswer
 

croustx a écrit :


 
 
Sur linux en headless, j'ai Qwen 3.6 en 27b Q4.
150k de contexte.
 
Et ça passe nickel.


Quel Q4 ? on a le choix entre 4 Q4 maintenant :D

n°46410
the_fennec
f3nn3cUs z3rd4
Posté le 26-08-2026 à 17:05:55  profilanswer
 

[:raztapeaupoulos]  
https://i.imgur.com/o5K4cYH.png
https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF
https://unsloth.ai/docs/models/qwen3.8-next
 
https://i.imgur.com/gXnCPFV.png
 
Bon, je DL quand même :o
 
C'est pas dans la main de llama.cpp:
https://github.com/ggml-org/llama.cpp/pull/27742
 
Un peu d'espoir:

Citation :


    5B active on VRAM, 20B experts in RAM and 50B Ngram parameters on disk, would lead to insane models every 16-32 GB RAM system with 4-8 GB VRAM could run well.
 
To cite their tech report:
 
    Scaling with Additional Parameters. Because embedding tables are sparsely accessed and determin-
    istically addressed, they can be scaled with negligible additional per-token computation and stored in
    off-accelerator storage (Google DeepMind, 2025; Cheng et al., 2026). We therefore move beyond the
    fixed-size setting and scale the N-gram vocabulary from 20V to 200V , where V denotes the base tokenizer
    vocabulary size of Qwen3.5 (Qwen Team, 2026).
 
https://github.com/QwenLM/Qwen3.8-F [...] report.pdf


 
https://i.imgur.com/C6brj2T.png
https://i.imgur.com/u1IgTMb.png


Message édité par the_fennec le 26-08-2026 à 17:42:16

---------------
Faudra que je teste un jour :o
n°46414
the_fennec
f3nn3cUs z3rd4
Posté le 26-08-2026 à 19:36:37  profilanswer
 

Qwen 3.8 27B Cold Fusion tested - 16GB Local LLM setup
Luke's Dev Lab
https://www.youtube.com/watch?v=wR_cLfRLBDs
 

Citation :

In this video we're going to look at Qwen3.8 27B Cold Fusion GAIN V1.1 NM DAU NEO MAX MTP from DavidAU. A previous finetune from DavidAU, Fable Fusion was pretty good in my tests, is this one for Qwen 3.8 as good compared to the base model?


 
TL;DR c'est nul :o


---------------
Faudra que je teste un jour :o
n°46415
neo world
Posté le 26-08-2026 à 19:43:33  profilanswer
 

je susi en train de backuper mon K3 telechargé hier (spoiler, c'est long, je vais upgrader le port du strix halo du Gbe vers 2,5Gb/s quand ce sera fini) ça devrait laisser de temps à décanter les bonnes quantisation. Je peux héberger les deux modèles mais pas les exposer en simultané.
 
Mais je sens que ça va finir avec Qwen 3.8 27b en modèle pour le tout venant et 3.8 flash next pour le debug, planification, orchestration (sauf si en terme de tokens/s le MoU aide bien). Le gain est pas si énorme en qualité de dev par rapport au 27b. C'est une sacrée réussite pour un modèle si "petit"

n°46418
neo world
Posté le 26-08-2026 à 19:57:50  profilanswer
 

Gemini qui m'a fait télécharger kimi k3 sans safetensors ... ils sont nécessaires pour colibri. Je dois retélécharger 1,5Tib  [:tee steewood]  
 

n°46420
neo world
Posté le 26-08-2026 à 20:07:22  profilanswer
 

pour ceux qui font de la veille de harness :
https://ryanalberts.github.io/best-of-Agent-Harnesses/
 
La partie pick by use case est potentiellement pratique (pas encore testé. Telechargement en cours toussa :o

n°46425
moyen_moin​s
chat réincarné
Posté le 26-08-2026 à 20:49:40  profilanswer
 

the_fennec a écrit :

Qwen 3.8 27B Cold Fusion tested - 16GB Local LLM setup
Luke's Dev Lab
https://www.youtube.com/watch?v=wR_cLfRLBDs

 
Citation :

In this video we're going to look at Qwen3.8 27B Cold Fusion GAIN V1.1 NM DAU NEO MAX MTP from DavidAU. A previous finetune from DavidAU, Fable Fusion was pretty good in my tests, is this one for Qwen 3.8 as good compared to the base model?

 

TL;DR c'est nul :o


En iq4 peut être ouais
En Q6, j'aime bien :o
Mais j'ai pas retesté les derniers ud3 d'unsloth

n°46434
the_fennec
f3nn3cUs z3rd4
Posté le 26-08-2026 à 23:43:27  profilanswer
 

Il y avait de l'orage ce soir, une micro-coupure et une des BC250 a reboot :(
 

Citation :

Cogitated for 6d 17h 45m


 
J'aurais pas tenu la semaine entière :/


---------------
Faudra que je teste un jour :o
n°46436
neo world
Posté le 26-08-2026 à 23:50:09  profilanswer
 

faut leur mettre un mini onduleur. J'en ai collé un dans la baie (700Wh. le truc doit probablement tenir 5-10 minutes max avant de partir en RTT mais au moins pas de problème de micro coupure ou de surtensions :jap:

n°46437
the_fennec
f3nn3cUs z3rd4
Posté le 26-08-2026 à 23:52:43  profilanswer
 

neo world a écrit :

je susi en train de backuper mon K3 telechargé hier (spoiler, c'est long, je vais upgrader le port du strix halo du Gbe vers 2,5Gb/s quand ce sera fini) ça devrait laisser de temps à décanter les bonnes quantisation. Je peux héberger les deux modèles mais pas les exposer en simultané.
 
Mais je sens que ça va finir avec Qwen 3.8 27b en modèle pour le tout venant et 3.8 flash next pour le debug, planification, orchestration (sauf si en terme de tokens/s le MoU aide bien). Le gain est pas si énorme en qualité de dev par rapport au 27b. C'est une sacrée réussite pour un modèle si "petit"


 
Te presse pas pour Qwen Next, vu les discussions dans la PR c'est pas pour demain:
https://github.com/ggml-org/llama.cpp/pull/27742
 
Mais un gars semble confirmé qu'un grosse partie du modèle, les n-gram embeddings n'ont pas besoin d'être en VRAM, ni même en RAM sur le long terme! Avec "un peu" d'offload CPU, on pourrait faire tourner ce modèle avec 32GB de VRAM? :love: Si c'est le cas l'arch Qwen 4 va tout défoncer! (on se hype comme on peut :o)

Citation :


sergey-automation
Qwen3.8-Flash-Next UD-IQ1_S on a 15× 8 GB GPU configuration: out of ~67.6 GiB of model weights, llama.cpp loaded only ~41.4 GiB into VRAM, while ~27.2 GiB remained in system RAM (CPU_Mapped), despite having sufficient total VRAM. sm_layer
 
phhusson
@sergey-automation yes that's the n-gram embeddings (also called PLE or per_layer_token_embd). It has very low reads and 0 computation, so there is no point in putting it in GPU. As I understand it, there is even barely any point in putting it in RAM. If I'm not mistaken, the behavior you're seeing is referred to as "mmap PLE offload" in this thread, and is considered a feature.


---------------
Faudra que je teste un jour :o
n°46438
the_fennec
f3nn3cUs z3rd4
Posté le 26-08-2026 à 23:56:33  profilanswer
 

neo world a écrit :

faut leur mettre un mini onduleur. J'en ai collé un dans la baie (700Wh. le truc doit probablement tenir 5-10 minutes max avant de partir en RTT mais au moins pas de problème de micro coupure ou de surtensions :jap:


 
J'en avait un, mais je l'ai viré. Il bouffait pas mal de jus et m'a fait une coupure quand sa batterie a lâché :lol:


---------------
Faudra que je teste un jour :o
n°46439
the_fennec
f3nn3cUs z3rd4
Posté le 27-08-2026 à 00:00:31  profilanswer
 

moyen_moins a écrit :


En iq4 peut être ouais
En Q6, j'aime bien :o
Mais j'ai pas retesté les derniers ud3 d'unsloth


 
Il compare le modèle de base vs le fine-tune avec des quants similaires. Le fine-tune, bouffe plus de token, boucle et fait plus d'erreurs :/
 
Je suis toujours en UD2, Q8_K_XL n'as pas de version UD3  [:julm3]


---------------
Faudra que je teste un jour :o
n°46440
neo world
Posté le 27-08-2026 à 00:00:53  profilanswer
 

j'en suis toujours au telechargement de K3 safetensors (huggingface me cap sévère là. J'en suis à 800GO mais bon ça peut tourner toute la nuit j'ai d'autres projets en cours [:spaarks:1] )
 
Je démarre aussi la partie lemonade en esperant pouvoir tourner sur deux pattes :
colibri pour les truc qui sont trop gros passera pas mais j'ai deux SSD NVME de 2TO et 128GB de RAM [:4lkalinedog]  
lemonade pour le plus serieux
 
Encore un peu de bidouille sécurité sur la protection de nextcloud accessible sans VPN (première fois de ma vie que je fais ça à la maison. Les scans depuis internet sont intensifs  [:leguidedubledard:1] ) et je peux enfin attaquer le harness et Qwen 3.8 flash next le retour :D

n°46441
neo world
Posté le 27-08-2026 à 00:02:47  profilanswer
 

the_fennec a écrit :


 
J'en avait un, mais je l'ai viré. Il bouffait pas mal de jus et m'a fait une coupure quand sa batterie a lâché :lol:


faut changer la batterie à peu près tous les ans (ils passe son temps à la charger / décharger pour ne pas faire de micro coupure). Dans le mien c'est une batterie 12v type scooter
 
Les vrais auront prévu la double arrivée electrique
Les autres négocieront une coupure de service avec le métier (femme et enfants :o )

n°46442
the_fennec
f3nn3cUs z3rd4
Posté le 27-08-2026 à 00:05:53  profilanswer
 

La flemme :o


---------------
Faudra que je teste un jour :o
 Page :   1  2  3  4  5  ..  46  47  48  ..  59  60  61  62  63  64

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)