Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
3308 connectés 

 


Je génère ...
Sondage à 3 choix possibles.
Ce sondage expirera le 20-09-2026 à 10:00




Attention si vous cliquez sur "voir les résultats" vous ne pourrez plus voter

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  65  66  67  68  69  70
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°49356
bifidusse
(actif)
Posté le 16-09-2026 à 13:24:21  profilanswer
 

Reprise du message précédent :

JohnSmith a écrit :

Merci pour les réponses  :jap:  
 
J’ai une 5060 8Go  :mouais:


 
Perso j'utilise Unsloth : https://github.com/unslothai/unsloth
Il est connu pour son fine tuning de modèle mais il fait très bien ce que tu demandes :
- tu l'installes
- tu choisis un modèle (il y a moyen de lui demander les modèles qui tiennent sur ta config et tu auras un boule verte, un "tight" ou un "OOM" (out of memory))
- tu attends qu'il d/l le modèle
- tu peux jouer avec
 
Je n'utilise pas LM, donc je ne peux pas comparer, mais Unsloth est à ma connaissance open-source si c'est un critère.
 
Il est encore en beta et les mises à jour sont fréquentes. Mais il tourne bien.

n°49366
the_fennec
f3nn3cUs z3rd4
Posté le 16-09-2026 à 15:12:57  profilanswer
 

JohnSmith a écrit :

Merci pour les réponses  :jap:  
 
J’ai une 5060 8Go  :mouais:


 
Pour du chat ça ira, après c'est plus chaut si tu veux faire du code, utiliser Openclaw ou Hermess
 
Pour le dimensionnement il y a deux cas:
* modèle dense, genre Qwen 27B, Muse ou Gemma 31B: tout doit tenir dans tes 8Go y compris le contexte.
* modèle MoE, genre Qwen 35B ou Gemma 24B, tu peux mettre des bouts en VRAM (le plus le mieux) et le reste en RAM.
 
Tu devras utiliser des modèle quantifiés (compressés) GGUF, tu peux essayer Gemma 12B "qat" pour commencer:
https://huggingface.co/unsloth/gemma-4-12B-it-qat-GGUF
 
Ensuite selon ce que tu veux vraiment faire, tu pourras essayer d'utiliser des modèles ou outils plus spécialisés.
 
Il ya plein de choix pour faire tourner le modèle. Unsloth Studio est nouveau et semble bien.
 
Perso je préfère utiliser llama.cpp directement, prends le zip "Windows x64 (Vulkan)" met le fichier de modèle et lance en utilisant la commande:
https://unsloth.ai/docs/models/gemm [...] deployment
https://github.com/ggml-org/llama.cpp/releases
 
Ensuite si ça marche et que ça te plais tu pourras essayer d'installer CUDA pour aller plus vite.


---------------
Faudra que je teste un jour :o
n°49367
JohnSmith
Executive vice president
Posté le 16-09-2026 à 15:13:49  profilanswer
 

Mais du coup la démarche qui consiste à maximiser le modèle selon son GPU (voire à stocker un peu en RAM)
C'est différent de sizer le LLM par rapport à un besoin.

 

Est ce qu'on a des abaques sur les capacités d'un 30B Q4 vs autre chose.

 

Comment rendre tangibles les capacité d'un modèle donné pour pouvoir humainement choisir le bon ?
Genre Twingo ou 4x4 ou Ferrari :o Mais pour faire quoi :o

Message cité 3 fois
Message édité par JohnSmith le 16-09-2026 à 15:22:25
n°49368
Pipould's
Posté le 16-09-2026 à 15:14:38  profilanswer
 

Neji Hyuga a écrit :


 
Ouais, quand j'ai raqué pour une 3090 FE à 1500 balles, je m'étais dit qu'à l'époque c'était un caprice, mais six ans plus tard, elle tape encore huit cent balles d'occaz, elle reste un incontournable des cartes grand public pour s'initier à l'IA locale et avec le mod MFG il y a de quoi lui donner une seconde vie en jeu.


 
800 tu es gentil. Ca se vend 1200 euros. 800 c'etait y'a 6-8 mois.

n°49371
bifidusse
(actif)
Posté le 16-09-2026 à 15:32:13  profilanswer
 

JohnSmith a écrit :

Mais du coup la démarche qui consiste à maximiser le modèle selon son GPU (voire à stocker un peu en RAM)  
C'est différent de sizer le LLM par rapport à un besoin.  
 
Est ce qu'on a des abaques sur les capacités d'un 30B Q4 vs autre chose.  
 
Comment rendre tangibles les capacité d'un modèle donné pour pouvoir humainement choisir le bon ?  
Genre Twingo ou 4x4 ou Ferrari :o Mais pour faire quoi :o


 
Moi ce qui m'a aidé c'est de savoir que certains modèles sont dédiés à la vision (analyse d'images), d'autres au texte pur, d'autres font les deux, certains ne font que de la création d'images...
 
Quand à la "qualité", j'ai pris le parti d'en télécharger quelques-uns (Gemma 4 petit, le 26B MoE, un petit qwen de 0,8 B, le dernier qwen, un modèle dédié vision de chez qwen...) et je teste.
 
Pas sûr d'avoir trouvé le "meilleur" modèle qui fait un peu tout. Peut-être que qwen est moins con que Gemma, mais de toutes façons en petits modèles pour nos petites machines (j'ai une 16GB), on ne va pas atteindre le raisonnement d'un cloud (je laisse aux autres le soin de me contredire ;) )

Message cité 1 fois
Message édité par bifidusse le 16-09-2026 à 15:35:14
n°49375
bifidusse
(actif)
Posté le 16-09-2026 à 15:36:56  profilanswer
 

bifidusse a écrit :


 
Moi ce qui m'a aidé c'est de savoir que certains modèles sont dédiés à la vision (analyse d'images), d'autres au texte pur, d'autres font les deux, certains ne font que de la création d'images... et qu'ils sont tous plus ou moins cons quand on leur demande quelque chose de trop global qui pourtant te semble évident (aller sur une page web, y trouver les url...).
 
Quand à la "qualité", j'ai pris le parti d'en télécharger quelques-uns (Gemma 4 petit, le 26B MoE, un petit qwen de 0,8 B, le dernier qwen, un modèle dédié vision de chez qwen...) et je teste. Tester me permet aussi de mieux comprendre comment ça marche et quelles sont les limitations.
 
Pas sûr d'avoir trouvé le "meilleur" modèle qui fait un peu tout. Peut-être que qwen est moins con que Gemma, mais de toutes façons en petits modèles pour nos petites machines (j'ai une 16GB), on ne va pas atteindre le raisonnement d'un cloud (je laisse aux autres le soin de me contredire ;) )


n°49376
moyen_moin​s
chat réincarné
Posté le 16-09-2026 à 15:37:28  profilanswer
 

ça chauffe dur ces bc-250...

n°49377
the_fennec
f3nn3cUs z3rd4
Posté le 16-09-2026 à 15:50:31  profilanswer
 

JohnSmith a écrit :

Mais du coup la démarche qui consiste à maximiser le modèle selon son GPU (voire à stocker un peu en RAM)  
C'est différent de sizer le LLM par rapport à un besoin.  
 
Est ce qu'on a des abaques sur les capacités d'un 30B Q4 vs autre chose.  
 
Comment rendre tangibles les capacité d'un modèle donné pour pouvoir humainement choisir le bon ?  
Genre Twingo ou 4x4 ou Ferrari :o Mais pour faire quoi :o


 
Il y a beaucoup de manuel et de subjectif dans la sélection de modèles. Ça dépends beaucoup de ce que tu veux réellement faire. De plus, beaucoup d'articles/vidéos/posts conseillent des trucs, juste pour faire du click et ne l'utilise pas vraiment derrière. Pareil pour ceux qui parlent d'Openclaw/Hermes en local, en réalité ils utilisent tous un modèle cloud...
 
Quelques conseils:
1 - Utiliser des modèles de base, genre Qwen, Gemma, Muse, etc.
2 - Prendre des modèles bien quantifiés: Unsloth est très bon.
3 - Utiliser des outils simple, llama.cpp :o
4 - Fais marcher ta config simplement, tu verras plus tard pour le reste...
 


---------------
Faudra que je teste un jour :o
n°49378
the_fennec
f3nn3cUs z3rd4
Posté le 16-09-2026 à 15:51:14  profilanswer
 

moyen_moins a écrit :

ça chauffe dur ces bc-250...


 
En effet j'ai du repasser l'une des deux en 24CU car elle plantait au bout d'un moment.


---------------
Faudra que je teste un jour :o
n°49379
Neji Hyuga
:grut:
Posté le 16-09-2026 à 15:54:52  profilanswer
 

Pipould's a écrit :

800 tu es gentil. Ca se vend 1200 euros. 800 c'etait y'a 6-8 mois.


 
Sur LBC et Vinted on trouve encore quelques exemplaires autours des 800 balles, sur eBay il y a eu des ventes à moins de mille balles dans l'été mais oui, ça peut partir autour des 1200 €, voir plus.
 
Si c'est uniquement pour les 24 GB de VRAM et animer un LLM à la maison, autant regarder du côté d'une Arc Pro B65, il y a 32 GB de VRAM et une garantie d'au moins deux ans. Alors oui, y'a pas CUDA.


---------------
Le Topic Unique des collections de cartes graphiques - GPUCHAN.ORG
n°49380
moyen_moin​s
chat réincarné
Posté le 16-09-2026 à 16:05:56  profilanswer
 

the_fennec a écrit :

 

En effet j'ai du repasser l'une des deux en 24CU car elle plantait au bout d'un moment.


j'ai pas ouvert les ailettes, j'ai mis un 120mm qui souffle dans les ailettes  via un adaptateur imprimé en 3d mais pas assez de pression, j'en ai rajouté un qui souffle sur les ailettes mais tant que c'est pas ouvert, ça sert à pas grand chose :/
105W de conso rien que dans le bios ...

Message cité 1 fois
Message édité par moyen_moins le 16-09-2026 à 16:10:57
n°49381
lapin
Posté le 16-09-2026 à 16:18:31  profilanswer
 

JohnSmith a écrit :

Mais du coup la démarche qui consiste à maximiser le modèle selon son GPU (voire à stocker un peu en RAM)  
C'est différent de sizer le LLM par rapport à un besoin.  
 
Est ce qu'on a des abaques sur les capacités d'un 30B Q4 vs autre chose.  
 
Comment rendre tangibles les capacité d'un modèle donné pour pouvoir humainement choisir le bon ?  
Genre Twingo ou 4x4 ou Ferrari :o Mais pour faire quoi :o


 
 
 
Dans LM STUDIO puis dans My Model (CTRL +3 pour le modèle sélectionné, dans le bandeau vertical en haut à droite clic sur <> Loald Model.
 
 
ça affiche ce menu:  
 
https://www.dropbox.com/scl/fi/gpafn6rjxem2tza9llvxj/R-glage-du-model-dans-LM-STUDIO.png?rlkey=f62ym2fqdc9gl3wvtm599xyri&st=er8abpcd&dl=1
 
 
Reste en 8192 Tokens, en CPU reste en 4 Threads car plus haut c'est plus lent et la concurence Threads CPU et déchargement GPU, l'IA devient débile même pour un truc simple, c'est à cause du nombre de threads CPU donc le plus bas possible.
Après, il faut trouver des réglages afin que l'IA ne tourne pas dans une boucle de raisonnement, et aussi ne bouffe pas ses Tokens inutilement en étant trop bavarde.
 
Le déchargement GPU à une énormé insidence sur la quantité de VRAM utilié, le nombre de Tokens aussi, augmenté Thread CPU décharge la VRAM du GPU vers la mémoire central au prix d'être débile.
 
Thread CPU sur la version Terminal de Llama Server c'est l'option -t suivie du nombre de Threads à alouer au moteur Llama.cpp.
Déchargement GPU correspond à -ngl suivit d'un nombre de 0 à 99 dans la version Terminal.
 
ça ressemble à ceci:

Citation :


llama-server.exe -hf google/gemma-4-31B-it-qat-q4_0-gguf -c 11996 -ngl 26 -t 4 -fa on -ctk q4_1 -ctv q4_0 --host 127.0.0.1 --port 8080


 
ou encore à ceci:
 

Citation :


llama-server.exe -hf google/gemma-4-31B-it-qat-q4_0-gguf -c 11996 -ngl 26 -t 4 -fa on -ctk q4_1 -ctv q4_0 --host 127.0.0.1 --port 8080


 
 
 
 
Tu devrais avoir un nombre de Tokens entre 16 Tokens par seconde et 24 Tokens par seconde, plus c'est haut mieux c'est, en texte seul c'est surtout la quantité de VRAM qui limite la puissance plus que le GPU.
 

n°49385
speedboyz3​0
Guide Michelin :o
Posté le 16-09-2026 à 16:34:56  profilanswer
 

Je lurk toujours une rtx pro 4500 32Gb :o

n°49395
the_fennec
f3nn3cUs z3rd4
Posté le 16-09-2026 à 17:00:34  profilanswer
 

moyen_moins a écrit :


j'ai pas ouvert les ailettes, j'ai mis un 120mm qui souffle dans les ailettes  via un adaptateur imprimé en 3d mais pas assez de pression, j'en ai rajouté un qui souffle sur les ailettes mais tant que c'est pas ouvert, ça sert à pas grand chose :/
105W de conso rien que dans le bios ...


 
Pareil, j'ai un Artic pro 12 mais ça suffit pas sur celle-la, l'autre ça passe. Après j'ai pas repast et ya aussi la loterie, les APUs sont pas passé pour une PS5, ya bien une raison.  
 

speedboyz30 a écrit :

Je lurk toujours une rtx pro 4500 32Gb :o


 
Et moi une 170hx a 200 balles :o


---------------
Faudra que je teste un jour :o
n°49397
the_fennec
f3nn3cUs z3rd4
Posté le 16-09-2026 à 17:18:28  profilanswer
 

You can offload most of Qwen3.8-Flash-Next's KV cache to RAM with little decode slowdown
https://www.reddit.com/r/LocalLLaMA [...] _kv_cache/
 
^ sur vLLM :(
 

Citation :

I'm pretty sure it can be done with any model based on qwen4exp, which Qwen's next local models will be based on. You can use a quant that barely fits in VRAM and still run at the model's maximum context length without kv cache quantization, since most of the KV cache can live in system RAM.


 
 [:delarue]  
 
Faut que je grate ce sujet!
 
A voir aussi:
[Release] SOTA GGUFs for Qwen3.8-Flash-Next: GSQ-RCO Providing Near Baseline Performance
https://www.reddit.com/r/LocalLLaMA [...] xt_gsqrco/
 
https://huggingface.co/ISTA-DASLab/ [...] Q-RCO-GGUF
 

Citation :


Q2_0 is built for speed. It avoids the quantization formats that rely on large lookup tables: those formats pack more accuracy into a given bit-width, but decoding them costs real time, and on this model that cost dominates inference. Q2_0 delivers 3.4x the prompt throughput and 1.9x lower end-to-end latency than IQ2_XS at a slightly smaller file size, and its decode rate stays flat across workloads instead of varying with the content.


 
 

Citation :

The IQ3_XXS model is the strongest operating point: it matches the base model exactly on AIME25 (100.00) and is within 0.51 points on GPQA-Diamond and 1.14 on LiveCodeBench v6, at roughly one fifth of the BF16 size.


 
Je DL le IQ3_XXS, mais le Q2 pourrait valoir le coup aussi!

Message cité 2 fois
Message édité par the_fennec le 16-09-2026 à 17:51:20

---------------
Faudra que je teste un jour :o
n°49400
moyen_moin​s
chat réincarné
Posté le 16-09-2026 à 17:36:30  profilanswer
 

the_fennec a écrit :


 
Pareil, j'ai un Artic pro 12 mais ça suffit pas sur celle-la, l'autre ça passe. Après j'ai pas repast et ya aussi la loterie, les APUs sont pas passé pour une PS5, ya bien une raison.  
 


On verra mais sur AE, je pense pas avoir acheté la crème...

the_fennec a écrit :


 
Et moi une 170hx a 200 balles :o


:D²²²

n°49401
SynE
Agri du dessert
Posté le 16-09-2026 à 17:38:56  profilanswer
 

the_fennec a écrit :


 
Pareil, j'ai un Artic pro 12 mais ça suffit pas sur celle-la, l'autre ça passe. Après j'ai pas repast et ya aussi la loterie, les APUs sont pas passé pour une PS5, ya bien une raison.  
 


 
T'as bien découpé les ailettes :o ?

n°49402
moyen_moin​s
chat réincarné
Posté le 16-09-2026 à 17:39:31  profilanswer
 

the_fennec a écrit :

You can offload most of Qwen3.8-Flash-Next's KV cache to RAM with little decode slowdown
https://www.reddit.com/r/LocalLLaMA [...] _kv_cache/
 

Citation :

I'm pretty sure it can be done with any model based on qwen4exp, which Qwen's next local models will be based on. You can use a quant that barely fits in VRAM and still run at the model's maximum context length without kv cache quantization, since most of the KV cache can live in system RAM.


 
 [:delarue]  
 
Faut que je grate ce sujet!
 
A voir aussi:
[Release] SOTA GGUFs for Qwen3.8-Flash-Next: GSQ-RCO Providing Near Baseline Performance
https://www.reddit.com/r/LocalLLaMA [...] xt_gsqrco/
 
https://huggingface.co/ISTA-DASLab/ [...] Q-RCO-GGUF
 

Citation :


Q2_0 is built for speed. It avoids the quantization formats that rely on large lookup tables: those formats pack more accuracy into a given bit-width, but decoding them costs real time, and on this model that cost dominates inference. Q2_0 delivers 3.4x the prompt throughput and 1.9x lower end-to-end latency than IQ2_XS at a slightly smaller file size, and its decode rate stays flat across workloads instead of varying with the content.


 
 

Citation :

The IQ3_XXS model is the strongest operating point: it matches the base model exactly on AIME25 (100.00) and is within 0.51 points on GPQA-Diamond and 1.14 on LiveCodeBench v6, at roughly one fifth of the BF16 size.


 
Je DL le IQ3_XXS, mais le Q2 pourrait valoir le coup aussi!


j'attends ton tuto :o

n°49403
the_fennec
f3nn3cUs z3rd4
Posté le 16-09-2026 à 17:45:18  profilanswer
 

SynE a écrit :


T'as bien découpé les ailettes :o ?


 
Non, je pense pas le faire. D'ailleurs les températures sont bien meilleures dans le boîtier imprimé qu'a l'air libre. Je dois toujours modifier le STL pour que ça soit plus propre...
 

moyen_moins a écrit :


j'attends ton tuto :o


 
ça vient :o


---------------
Faudra que je teste un jour :o
n°49405
M300A
Posté le 16-09-2026 à 17:49:06  profilanswer
 

the_fennec a écrit :

You can offload most of Qwen3.8-Flash-Next's KV cache to RAM with little decode slowdown
https://www.reddit.com/r/LocalLLaMA [...] _kv_cache/

 
Citation :

I'm pretty sure it can be done with any model based on qwen4exp, which Qwen's next local models will be based on. You can use a quant that barely fits in VRAM and still run at the model's maximum context length without kv cache quantization, since most of the KV cache can live in system RAM.

 

[:delarue]

 

Faut que je grate ce sujet!

 

A voir aussi:
[Release] SOTA GGUFs for Qwen3.8-Flash-Next: GSQ-RCO Providing Near Baseline Performance
https://www.reddit.com/r/LocalLLaMA [...] xt_gsqrco/

 

https://huggingface.co/ISTA-DASLab/ [...] Q-RCO-GGUF

 
Citation :


Q2_0 is built for speed. It avoids the quantization formats that rely on large lookup tables: those formats pack more accuracy into a given bit-width, but decoding them costs real time, and on this model that cost dominates inference. Q2_0 delivers 3.4x the prompt throughput and 1.9x lower end-to-end latency than IQ2_XS at a slightly smaller file size, and its decode rate stays flat across workloads instead of varying with the content.

 


Citation :

The IQ3_XXS model is the strongest operating point: it matches the base model exactly on AIME25 (100.00) and is within 0.51 points on GPQA-Diamond and 1.14 on LiveCodeBench v6, at roughly one fifth of the BF16 size.

 

Je DL le IQ3_XXS, mais le Q2 pourrait valoir le coup aussi!

 

Oé enfin si c'est pour remplacer des GPUs a 10k par des barrettes de RAM à 4k l'unité, on avance pas des masses  [:mooonblood:4]


---------------
:wq
n°49407
the_fennec
f3nn3cUs z3rd4
Posté le 16-09-2026 à 17:52:23  profilanswer
 

le coup du KV cache en RAM c'est sur VLLM
 [:whiteponey]


---------------
Faudra que je teste un jour :o
n°49409
M300A
Posté le 16-09-2026 à 17:54:45  profilanswer
 

VLLM c'est un truc d'homme  [:yobou:5]

 

C'est pas pour ceux qui ont des petits GPUs :o

Message cité 1 fois
Message édité par M300A le 16-09-2026 à 17:55:21

---------------
:wq
n°49414
lapin
Posté le 16-09-2026 à 18:14:21  profilanswer
 

Bon, là j'en ai marre j'en suis à plus de 40 itérations de la simple recopie d'une bête forme géométrique somme toute assez simple.
Déjà que d'habitude ça lui prend entre 20 et 48 minutes pour faire de la merde, mais là c'est pire que tous.
 
Je ne suis certes pas un génie en prompting, j'en suis même sûrement très très loin y a des notions que je me maitrise pas, surtout pour des modèles Locaux et sûrement qu'il y a un truc qui m'échappe, mais là j'abandonne !!!
 
 
Il y a juste la forme géométrique à recopier avec le fond blanc:
 
https://www.dropbox.com/scl/fi/p3ln [...] je060&dl=1
 
Et il me pond ceci:
 
https://www.dropbox.com/scl/fi/ihod [...] pxp0l&dl=1
 
 

Citation :


<svg width="500" height="595" viewBox="0 0 500 595" xmlns="http://www.w3.org/2000/svg">
  <!-- Fond blanc -->
  <rect width="500" height="595" fill="white" />
   
  <!-- Style des lignes -->
  <g fill="none" stroke="black" stroke-width="2">
    <!-- Segment AB -->
    <line x1="50" y1="50" x2="450" y2="250" />
    <!-- Segment BC -->
    <line x1="450" y1="250" x2="400" y2="500" />
    <!-- Segment CD -->
    <line x1="400" y1="500" x2="50" y2="350" />
    <!-- Segment DA -->
    <line x1="50" y1="350" x2="50" y2="50" />
     
    <!-- Segment EF -->
    <line x1="200" y1="100" x2="200" y2="500" />
    <!-- Segment FG -->
    <line x1="200" y1="500" x2="50" y2="450" />
    <!-- Segment GH -->
    <line x1="50" y1="450" x2="200" y2="350" />
     
    <!-- Segment HE -->
    <line x1="200" y1="350" x2="200" y2="100" />
     
    <!-- Segments internes (Perspective) -->
    <line x1="50" y1="350" x2="400" y2="500" /> <!-- D vers C (déjà fait par CD) -->
    <line x1="50" y1="350" x2="200" y2="350" /> <!-- D vers H -->
    <line x1="200" y1="100" x2="450" y2="250" /> <!-- E vers B -->
  </g>
 
  <!-- Étiquettes des points -->
  <g fill="black" font-family="Arial" font-size="16">
    <text x="40" y="45">A</text>
    <text x="455" y="265">B</text>
    <text x="410" y="515">C</text>
    <text x="30" y="365">D</text>
    <text x="205" y="95">E</text>
    <text x="205" y="515">F</text>
    <text x="30" y="465">G</text>
    <text x="205" y="365">H</text>
  </g>
</svg>


 
 
Donc je pense que:
 
https://www.dropbox.com/scl/fi/65krx0pog2x5k8lolug9u/Gemini_Generated_Image_lde1wllde1wllde1.jpg?rlkey=tq8pkpxqd02zojota60fmh39n&st=7qaqxmc8&dl=1
 
 
Je crois que le pire c'est que c'est bien pire qu'avec les ancienne version à la fois de LM STUDIO et du moteur Llama.cpp
 
Avant, il y arrivait presque bon ça lui prenait entre 20 minutes et une heure, mais c'était passable:
 
https://www.dropbox.com/scl/fi/t04e [...] mrcd5&dl=1
 
https://www.dropbox.com/scl/fi/392p [...] rmo9t&dl=1

Message cité 2 fois
Message édité par lapin le 16-09-2026 à 18:19:59
n°49421
the_fennec
f3nn3cUs z3rd4
Posté le 16-09-2026 à 18:40:06  profilanswer
 

M300A a écrit :

VLLM c'est un truc d'homme  [:yobou:5]
 
C'est pas pour ceux qui ont des petits GPUs :o


 
Un truc de riche, il lui faut plus de VRAM et pas moyen de panacher, genre Windows, Linux, ReactOS, Vulkan, COBOL :o


---------------
Faudra que je teste un jour :o
n°49423
the_fennec
f3nn3cUs z3rd4
Posté le 16-09-2026 à 18:48:01  profilanswer
 

lapin a écrit :

Bon, là j'en ai marre j'en suis à plus de 40 itérations de la simple recopie d'une bête forme géométrique somme toute assez simple.
Déjà que d'habitude ça lui prend entre 20 et 48 minutes pour faire de la merde, mais là c'est pire que tous.
 
Je ne suis certes pas un génie en prompting, j'en suis même sûrement très très loin y a des notions que je me maitrise pas, surtout pour des modèles Locaux et sûrement qu'il y a un truc qui m'échappe, mais là j'abandonne !!!
 
 
Il y a juste la forme géométrique à recopier avec le fond blanc:
 
https://www.dropbox.com/scl/fi/p3ln [...] je060&dl=1
 
Et il me pond ceci:
 
https://www.dropbox.com/scl/fi/ihod [...] pxp0l&dl=1


 
Un LLM n'a pas la notion de 3D/2D ou géométrie, la vision peut extraire des tags/notions mais il n'y pas de lien logique entre ce que tu vois et le SVG.
 
Pour y arriver il te faut une boucle comme en programmation (étape 4 serait compilation/tests):
1 - vision de l'image
2 - generation du svg
3 - generation de l'image du svg
4 - comparaison: est-ce que l'image du SVG est assez similaire?
5 - oui -> exit; non -> boucle en 1
 
Idéalement il faut utiliser un MCP ou une skill/outil dédiée a la génération de SVG.


---------------
Faudra que je teste un jour :o
n°49425
M300A
Posté le 16-09-2026 à 18:52:12  profilanswer
 

the_fennec a écrit :

 

Un truc de riche, il lui faut plus de VRAM et pas moyen de panacher, genre Windows, Linux, ReactOS, Vulkan, COBOL :o

 

LLM sur ReactOS avec une matrox mystique émulée  [:calimefrog:5]

Message cité 1 fois
Message édité par M300A le 16-09-2026 à 19:37:27

---------------
:wq
n°49430
moyen_moin​s
chat réincarné
Posté le 16-09-2026 à 19:17:50  profilanswer
 

bon, configuration du bc-250 en cours.
dès que le bc-250 seul fonctionne, je teste avec le gpu en plus [:ocube]

 

edit: test rapide
Qwen3.5-9B Q4_K_M | Vulkan | pp512 : 271 tok/s  |  tg128 : 44,9 tok/s
Qwen3.5-35B-A3B IQ2_M (10,6 GiB) | pp512 : 365 tok/s | tg128 : 77,7 tok/s

Message cité 1 fois
Message édité par moyen_moins le 16-09-2026 à 19:26:19
n°49433
the_fennec
f3nn3cUs z3rd4
Posté le 16-09-2026 à 19:36:17  profilanswer
 

M300A a écrit :


 
LLM sur ReactOS avec una matroc mystique émulée  [:calimefrog:5]


 
+une paire de Voodoo 2 en SLI pour l'inférence :o


---------------
Faudra que je teste un jour :o
n°49434
the_fennec
f3nn3cUs z3rd4
Posté le 16-09-2026 à 19:36:58  profilanswer
 

moyen_moins a écrit :

bon, configuration du bc-250 en cours.  
dès que le bc-250 seul fonctionne, je teste avec le gpu en plus [:ocube]
 
edit: test rapide
Qwen3.5-9B Q4_K_M | Vulkan | pp512 : 271 tok/s  |  tg128 : 44,9 tok/s
Qwen3.5-35B-A3B IQ2_M (10,6 GiB) | pp512 : 365 tok/s | tg128 : 77,7 tok/s


 
 :jap: ça marche! T'es en 24CU?


---------------
Faudra que je teste un jour :o
n°49435
neo world
Posté le 16-09-2026 à 19:42:37  profilanswer
 

the_fennec a écrit :


 
+une paire de Voodoo 2 en SLI pour l'inférence :o


manque le DRAM disk :o
 
https://web.archive.org/web/20230224024921im_/ddramdisk.store/wp-content/uploads/2022/05/TOP-1.jpg
 
 
Ca fera très moderne avec un bi P3. Facilement un token toutes les 10 minutes :o

n°49436
moyen_moin​s
chat réincarné
Posté le 16-09-2026 à 19:43:17  profilanswer
 

the_fennec a écrit :


 
 :jap: ça marche! T'es en 24CU?


j'étais en 24 CU ouais.
là, ça refait une tentative mais avec 40 CU.
par contre, j'arrive pas à gratter encore de la VRAM, ça échoue [:transparency]

n°49437
M300A
Posté le 16-09-2026 à 19:43:45  profilanswer
 

Ça a existé ça ? Jamais vu :D

 

Ceci dit j'ai vu passer que Facebook avait bricolé un adapteur PCI-E DDR4 pour ajouter de la ram sur les serveurs DDR5 faute de dispos


---------------
:wq
n°49438
the_fennec
f3nn3cUs z3rd4
Posté le 16-09-2026 à 20:04:22  profilanswer
 

moyen_moins a écrit :


j'étais en 24 CU ouais.
là, ça refait une tentative mais avec 40 CU.
par contre, j'arrive pas à gratter encore de la VRAM, ça échoue [:transparency]


 
T'es a combien en VRAM?
 
Perso j'ai ça pour grub:

Code :
  1. GRUB_CMDLINE_LINUX_DEFAULT="quiet mitigations=off apparmor=0 amd_iommu=off iomem=relaxed ttm.pages_limit=3840000 ttm.page_pool_size=3840000"


 
Ça me permet de monter assez haut, 15GB grand max, mais la limite est fine entre le max et le kernel qui tue le process.
 
Autrement j'ai ça dans mon script pour lancer llama.cpp:

Code :
  1. export AMD_OVERRIDE_DEVICE_ID=0x731F
  2. export MESA_VK_DEVICE_SELECT=1002:731f
  3. export radv_enable_unified_heap_on_apu=true
  4. #export GGML_VULKAN_DEVICE_MEMORY_LIMIT=12884901888
  5. export GGML_VK_ASYNC_USE_TRANSFER_QUEUE=1
  6. export GGML_VK_ALLOW_GRAPHICS_QUEUE=1
  7. #export GGML_RPC_DEBUG=1
  8. #export GGML_VK_DISABLE_F16=1
  9. #export GGML_VK_DISABLE_COOPMAT=1
  10. #export VK_ICD_FILENAMES=/usr/share/vulkan/icd.d/radeon_icd.x86_64.json


 
Ya plein de trucs commentés mais ça peut te donner des idées peut être.
 
T'as quoi qui tourne en background?


---------------
Faudra que je teste un jour :o
n°49439
yohaskan
Posté le 16-09-2026 à 20:05:13  profilanswer
 

Hop !
Triss est passé en mode agent, et gère la comm avec Cline sur Vscode
évidement en local, et en vocal...
Ah, vous noterez que Cline peut continuer a overthink tant qu'il veut, pendant que je cause et contrôle son status en papotant avec Triss :whistle:  
https://media1.tenor.com/m/tabuI4OfQHsAAAAC/the-office-pam-beesly.gif
C'est le Qwen 3.8 27B qui fait les deux
https://youtu.be/IzPfxbHqfqU

n°49440
moyen_moin​s
chat réincarné
Posté le 16-09-2026 à 20:06:06  profilanswer
 

https://rehost.diberie.com/Picture/Get/t/544649

 

Les 14Go sont bien là, fallait faire un cold boot.
Par contre pour le moment, pas de RX6700 visible. :(

n°49442
M300A
Posté le 16-09-2026 à 20:08:51  profilanswer
 

Installation très propre :o


---------------
:wq
n°49445
moyen_moin​s
chat réincarné
Posté le 16-09-2026 à 20:15:28  profilanswer
 

M300A a écrit :

Installation très propre :o


oui mais la RX6700 est là  [:papa titus]

 

edit: c'est juste un peu lent de charger les modèles par l'usb3 :o


Message édité par moyen_moins le 16-09-2026 à 20:16:22
n°49446
the_fennec
f3nn3cUs z3rd4
Posté le 16-09-2026 à 20:18:27  profilanswer
 

J'approuve l'install :jap:
 
Il dit quoi lspci?


---------------
Faudra que je teste un jour :o
n°49447
chris282
id steam/psn : chris282_fr
Posté le 16-09-2026 à 20:21:00  profilanswer
 

lapin a écrit :

Bon, là j'en ai marre j'en suis à plus de 40 itérations de la simple recopie d'une bête forme géométrique somme toute assez simple.
Déjà que d'habitude ça lui prend entre 20 et 48 minutes pour faire de la merde, mais là c'est pire que tous.
 
Je ne suis certes pas un génie en prompting, j'en suis même sûrement très très loin y a des notions que je me maitrise pas, surtout pour des modèles Locaux et sûrement qu'il y a un truc qui m'échappe, mais là j'abandonne !!!
 
 
Il y a juste la forme géométrique à recopier avec le fond blanc:
 
https://www.dropbox.com/scl/fi/p3ln [...] je060&dl=1
 
Et il me pond ceci:
 
https://www.dropbox.com/scl/fi/ihod [...] pxp0l&dl=1
 
 

Citation :


<svg width="500" height="595" viewBox="0 0 500 595" xmlns="http://www.w3.org/2000/svg">
  <!-- Fond blanc -->
  <rect width="500" height="595" fill="white" />
   
  <!-- Style des lignes -->
  <g fill="none" stroke="black" stroke-width="2">
    <!-- Segment AB -->
    <line x1="50" y1="50" x2="450" y2="250" />
    <!-- Segment BC -->
    <line x1="450" y1="250" x2="400" y2="500" />
    <!-- Segment CD -->
    <line x1="400" y1="500" x2="50" y2="350" />
    <!-- Segment DA -->
    <line x1="50" y1="350" x2="50" y2="50" />
     
    <!-- Segment EF -->
    <line x1="200" y1="100" x2="200" y2="500" />
    <!-- Segment FG -->
    <line x1="200" y1="500" x2="50" y2="450" />
    <!-- Segment GH -->
    <line x1="50" y1="450" x2="200" y2="350" />
     
    <!-- Segment HE -->
    <line x1="200" y1="350" x2="200" y2="100" />
     
    <!-- Segments internes (Perspective) -->
    <line x1="50" y1="350" x2="400" y2="500" /> <!-- D vers C (déjà fait par CD) -->
    <line x1="50" y1="350" x2="200" y2="350" /> <!-- D vers H -->
    <line x1="200" y1="100" x2="450" y2="250" /> <!-- E vers B -->
  </g>
 
  <!-- Étiquettes des points -->
  <g fill="black" font-family="Arial" font-size="16">
    <text x="40" y="45">A</text>
    <text x="455" y="265">B</text>
    <text x="410" y="515">C</text>
    <text x="30" y="365">D</text>
    <text x="205" y="95">E</text>
    <text x="205" y="515">F</text>
    <text x="30" y="465">G</text>
    <text x="205" y="365">H</text>
  </g>
</svg>


 
 
Donc je pense que:
 
https://www.dropbox.com/scl/fi/65kr [...] qxmc8&dl=1
 
 
Je crois que le pire c'est que c'est bien pire qu'avec les ancienne version à la fois de LM STUDIO et du moteur Llama.cpp
 
Avant, il y arrivait presque bon ça lui prenait entre 20 minutes et une heure, mais c'était passable:
 
https://www.dropbox.com/scl/fi/t04e [...] mrcd5&dl=1
 
https://www.dropbox.com/scl/fi/392p [...] rmo9t&dl=1


le prof en train de bench l'ia pour corriger les copies a sa place  [:jordan_barretoidella:8]

n°49448
the_fennec
f3nn3cUs z3rd4
Posté le 16-09-2026 à 20:23:07  profilanswer
 

yohaskan a écrit :

Hop !
Triss est passé en mode agent, et gère la comm avec Cline sur Vscode
évidement en local, et en vocal...
Ah, vous noterez que Cline peut continuer a overthink tant qu'il veut, pendant que je cause et contrôle son status en papotant avec Triss :whistle:  
https://media1.tenor.com/m/tabuI4Of [...] beesly.gif
C'est le Qwen 3.8 27B qui fait les deux
https://youtu.be/IzPfxbHqfqU


 
https://i.imgur.com/XgG1MPx.png
 
FTFY :o


---------------
Faudra que je teste un jour :o
n°49452
yohaskan
Posté le 16-09-2026 à 20:33:01  profilanswer
 

Uhuhu Enfoiré :D  
https://media1.tenor.com/m/dnvTJv5n4K0AAAAC/joaquin-phoenix-happy.gif
 

 Page :   1  2  3  4  5  ..  65  66  67  68  69  70

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)