Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
7104 connectés 

 


Dernière réponse
Sujet : Infra IA : aide au choix et troubleshot de LLM Locaux
Tronklou Le secret c'est scotch papier, rad ouvert et undervolt :O

Votre réponse
Nom d'utilisateur    Pour poster, vous devez être inscrit sur ce forum .... si ce n'est pas le cas, cliquez ici !
Le ton de votre message                        
                       
Votre réponse


[b][i][u][strike][spoiler][fixed][cpp][url][email][img][*]   
 
   [quote]
 

Options

 
Vous avez perdu votre mot de passe ?


Vue Rapide de la discussion
Tronklou Le secret c'est scotch papier, rad ouvert et undervolt :O
neo world Mets y un peu de scotch ou un boîtier decoupé à l’arrache pour faire diversion :o
moyen_moins

Pipould's a écrit :

 

Tu as quoi comme distro dessus?

 

C'est ultra chaud les bc250 de base....


Fedora server 44 il me semble, j'ai fait l'install un soir, je me souviens plus [:tinostar]
Mais oui, c'est chaud [:moonbloood:2]

 

Edit: pas de photos, là, j'avoue j'ai un peu honte :whistle:

Pipould's

moyen_moins a écrit :

sympa !
j'suis toujours à 40CU mais j'ai un 140mm qui souffle sur le côté rad, un 120mm qui souffle côté RAM et un 120mm qui essaie de pousser l'air dans les ailettes :o
et le truc j'arrive à peine à le toucher :sweat:

 

par contre, je préfère peculiar-ragdoll/Unsloth-Ornith-1.5-35B-A3B à peculiar-ragdoll/Nail-Qwen3.6-35B-A3B-GGUF-MTP
le NAIL, le comportement est tout pété avec le template jinja je trouve :/
je vais essayer de repasser sur du unsloth pur et dur ou essayer mudler/Qwen3.6-35B-A3B-APEX-GGUF [:paysan]

 

Tu as quoi comme distro dessus?

 

C'est ultra chaud les bc250 de base....

 

La mienne est a 100c comme ça :

 

https://i.ibb.co/Y41kDgXG/IMG-20260926-200830.jpg

moyen_moins sympa !
j'suis toujours à 40CU mais j'ai un 140mm qui souffle sur le côté rad, un 120mm qui souffle côté RAM et un 120mm qui essaie de pousser l'air dans les ailettes :o
et le truc j'arrive à peine à le toucher :sweat:
 
par contre, je préfère peculiar-ragdoll/Unsloth-Ornith-1.5-35B-A3B à peculiar-ragdoll/Nail-Qwen3.6-35B-A3B-GGUF-MTP
le NAIL, le comportement est tout pété avec le template jinja je trouve :/
je vais essayer de repasser sur du unsloth pur et dur ou essayer mudler/Qwen3.6-35B-A3B-APEX-GGUF [:paysan]
the_fennec

moyen_moins a écrit :


il trouve les entités, comprend à peu près ce qu'on lui demande (genre comment est la qualité de l'air aujourd'hui ? et il répond dehors j'en sais rien mais dedans et il cite les 2 capteurs avec une conclusion).
et le tout assez rapidement !
faudrait vraiment que j'essaie de voir pour faire avec esphome ou acheter une enceinte qui répond au question via HA [:paysan]


 
Je suis con, je pensais que tu avais ajouté du monitoring (Beszel) de la BC250 dans HA :lol:
 
D'ailleurs je viens d'ajouter le monitoring de mon merdier:
https://i.imgur.com/57WqBgi.png  
 
Je pense que mes soucis de ///// sont dus a une surchauffe d'une des BC250, je l'ai remise a 24CU et ça a l'air de tenir!
C'est celle qui n'a pas le boîtier 3D. Faut que je me sorte les doigts et que je change le modèle, impression, repaste et ça devrait aller mieux.

moyen_moins

the_fennec a écrit :


 
Cool il affiche quoi HA?


il trouve les entités, comprend à peu près ce qu'on lui demande (genre comment est la qualité de l'air aujourd'hui ? et il répond dehors j'en sais rien mais dedans et il cite les 2 capteurs avec une conclusion).
et le tout assez rapidement !
faudrait vraiment que j'essaie de voir pour faire avec esphome ou acheter une enceinte qui répond au question via HA [:paysan]

the_fennec

moyen_moins a écrit :


J'ai lancé les tests sur 2 iq4_xs, je vais bien voir.
Faudrait que je tente aussi un Qwen 3.8 légèrement plus gros.
 
le ornith 1.5 en iq4_xs passe, 256k de contexte en kv q8/q4. par contre, sur la conso, on sent que la RX6700 est moins "utilisée" avec la répartition des layers qui est plus orienté sur le bc-250.
 
edit: le qwen 3.6 35B passe en iq4_xs mais celui que j'ai choisis, je le trouve moins bon que le ornith [:paysan] (même contexte/kv cache)
 
edit²: par contre, l'intégration llama.cpp dans home asisstant marche bien de concert avec le bc-250+RX6700, je suis assez impressionné.


 
Cool il affiche quoi HA?

the_fennec

lapin a écrit :


Ah oui, carrément, tu ne lis pas, autant ne pas, je ne te parlerais plus et en plus en me quotant tu déformes mes propos au moment du quote en supprimant une partie de mon texte dans le but de me décrédibilisé, bravo à toi !!!!


 
C'est que tu n'as pas lu/compris ce que j'ai écris et que tu copies/colles Gemini sans remettre en question ce qui est écris. LMStudio n'est pas open-source, ils ont leur propre build basé sur un commit de llama.cpp, mais il est différent et patché. Le problème à déjà été remonté plus d'une fois sur Reddit ou ici aussi.

moyen_moins

the_fennec a écrit :

 

c'est dommage de pas profiter des 20GB+ de ta config, il faut que tu essayes en split tensor aussi.


J'ai lancé les tests sur 2 iq4_xs, je vais bien voir.
Faudrait que je tente aussi un Qwen 3.8 légèrement plus gros.

 

le ornith 1.5 en iq4_xs passe, 256k de contexte en kv q8/q4. par contre, sur la conso, on sent que la RX6700 est moins "utilisée" avec la répartition des layers qui est plus orienté sur le bc-250.

 

edit: le qwen 3.6 35B passe en iq4_xs mais celui que j'ai choisis, je le trouve moins bon que le ornith [:paysan] (même contexte/kv cache)

 

edit²: par contre, l'intégration llama.cpp dans home asisstant marche bien de concert avec le bc-250+RX6700, je suis assez impressionné.

lapin eisfrosch : L'état chaotique de la programmation sur GPU
https://www.youtube.com/watch?v=9-DiGrnz8l8
 
Par contre le Youtber bien que Français parle en Anglais et y a pas de Traduction.
lapin

the_fennec a écrit :


 

lapin a écrit :

Je n'ai fait que copié coller ... gemini


 
J'utilise pas LMSudio, si un truc marche pas dessus BALEC. C'est juste un soft parasite comme Ollama qui essaye de faire du pognon sur llama.cpp sans contribuer en retour.


 
Ah oui, carrément, tu ne lis pas, autant ne pas, je ne te parlerais plus et en plus en me quotant tu déformes mes propos au moment du quote en supprimant une partie de mon texte dans le but de me décrédibilisé, bravo à toi !!!!
 
 

the_fennec

lapin a écrit :

Je n'ai fait que copié coller ... gemini


 
J'utilise pas LMSudio, si un truc marche pas dessus BALEC. C'est juste un soft parasite comme Ollama qui essaye de faire du pognon sur llama.cpp sans contribuer en retour.

the_fennec

moyen_moins a écrit :

J'ai un qwen 3.6 35b et un ornith 1.5 35B que je dois tester
Je peux toujours essayer de mettre un qwen 3.8 27b un peu plus gros mais les 10Go de la 6700 sont vite limitant vu que c'est la carte prioritaire (prefill plus intéressant).
 
Je regardais en occase pour au moins 12Go avec préférence 16Go mais les prix aussi c'est encore pire qu'avant...
 
Et en neuf, ma 9060xt a pris 200 balles !  :sweat:


 
c'est dommage de pas profiter des 20GB+ de ta config, il faut que tu essayes en split tensor aussi.

lapin

the_fennec a écrit :


 
 
Il n'y a pas de build "llama.cpp-win-x86_64-vulkan-avx2" et LMSTUDIO est closed source (pas tout, mais le UI/moteur n'est pas dispo). LMSTUDIO a son propre build de llama.cpp et il ne correspond pas aux sources officielles. UD3 a été ajouté il y a plus d'un mois, ça devrait marcher depuis le temps.
 
moyen_moins n'est pas le premier a avoir des soucis avec LMSTUDIO, en tout cas chez moi ça marche :o


 
Je n'ai fait que copié coller Manifest JSON depuis Manage depuis Runtime de l'application LM STUDIO.
 
 
En tout cas gemini n'est pas d'accord avec tes affirmations comme quoi LM STUDIO serait très en retard de plus d'un moi de Llama.cpp disponible sur Github.
 
https://share.gemini.google/mHeA8KgJkvd8
 

Citation :


La release b11189 n'est pas du tout en retard : elle a seulement quelques heures d'écart (ou tout au plus un jour) par rapport à la b11195.
 
Le projet **llama.cpp** utilise un système d'intégration continue (CI) qui génère automatiquement une nouvelle build numérotée (estampillée `b...`) dès que des commits ou correctifs sont fusionnés sur le dépôt officiel.
 
Voici la situation exacte :
 
Écart de builds : seulement 6 numéros de révision d'écart (`b11189` contre `b11195`).
Délai temporel : quelques heures à peine, plusieurs builds étant fréquemment publiées au cours d'une même journée.
Impact pratique : le moteur Vulkan embarqué dans votre version de LM Studio est virtuellement aligné sur la version la plus récente de GitHub. À moins qu'un correctif ultra-spécifique n'ait été poussé dans les toutes dernières heures pour un modèle précis, vous ne manquez aucune fonctionnalité majeure.
 
---
 
Vous utilisez donc une version extrêmement récente du moteur, quasiment synchrone avec le développement actif sur GitHub.
 


 
 
Actuellement dans LM STUDIO puis dans Configuration puis dans Runtime, puis les trois petis point verticau à droite de Vulkan llama.cpp (Windows) v2.46.0 Vulkan accelerated llama.cpp engine, à Manage Version puisl'icônee qui ressemble à un paragraphe de texte avec pour infobulle View Details For V2.46.0 puis la fenêtre Runtime Details apparait.
 
 
 
J'ai ceci qui s'affiche:

Citation :


Vulkan llama.cpp (Windows): v2.46.0
 
Vulkan accelerated llama.cpp engine
 
- llama.cpp release b11189 (commit a25c9865f)


 
 
Puis ensuite, si je clique sur Manifest JSON il dit ceci:
 

Citation :


{
  "extension_type": "engine",
  "domains": [
    "llm",
    "embedding"
  ],
  "engine": "llama.cpp",
  "target_libraries": [
    {
      "name": "llm_engine_vulkan.node",
      "type": "llm_engine",
      "version": "0.1.2"
    },
    {
      "name": "liblmstudio_bindings_vulkan.node",
      "type": "liblmstudio",
      "version": "0.2.26"
    }
  ],
  "supported_model_formats": [
    "gguf"
  ],
  "engine_protocol_server": {
    "runtime_kind": "llama-server",
    "executable_relative_path": "llama-server.exe"
  },
  "name": "llama.cpp-win-x86_64-vulkan-avx2",
  "version": "2.46.0",
  "platform": "win",
  "cpu": {
    "architecture": "x86_64",
    "instruction_set_extensions": [
      "AVX2"
    ]
  },
  "gpu": {
    "framework": "Vulkan"
  },
  "manifest_version": "4",
  "minimum_lmstudio_version": "0.4.0+15",
  "minimum_llmster_version": "0.0.1+9",
  "vendor_lib_package_names": [
    "win-llama-vulkan-vendor-v2"
  ]
}


 
Donc je ne fais encore une fois que de faire un copié coller donc pourquoi me dire que

the_fennec a écrit :

Il n'y a pas de build "llama.cpp-win-x86_64-vulkan-avx2"

, pour un copié collé qui provient de LM STUDIO lui-même !!!??
 
Gemini dit ceci pour AVX2 sur Llama.cpp: https://share.gemini.google/yvABywV07Idc
 
 

Citation :


La désignation `"llama.cpp-win-x86_64-vulkan-avx2"` signifie que le moteur est compilé pour utiliser l'accélération GPU Vulkan, tout en s'assurant que la partie du code exécutée par le processeur (CPU) utilise les instructions optimisées AVX2.
 
Même lorsque l'API Vulkan est activée pour utiliser la carte graphique, llama.cpp ne transfère jamais 100 % du travail au GPU. Le processeur reste indispensable dans le processus d'inférence pour plusieurs raisons techniques :
 
Le déchargement partiel (Partial Offloading) : Si les poids d'un modèle d'intelligence artificielle dépassent la capacité de mémoire vidéo disponible (comme les 8 Go de VRAM de votre AMD Radeon RX Vega 56), les couches du modèle qui ne rentrent pas dans la carte graphique sont maintenues et calculées par le processeur. Les instructions AVX2 (Advanced Vector Extensions 2) sont alors cruciales pour que le CPU effectue ces lourds calculs matriciels le plus rapidement possible.
Le repli technique (Fallback) : Le développement du backend Vulkan sur llama.cpp est continu. Si une opération mathématique spécifique (un "op" tensoriel) requise par un modèle n'est pas encore prise en charge par l'API Vulkan, le moteur délègue automatiquement et instantanément ce calcul au processeur.
La tokenisation et le traitement des données : La conversion de votre texte en "tokens" compréhensibles par le modèle au début du prompt, ainsi que le décodage des tokens en texte lisible à la fin, sont des opérations exclusivement gérées par le CPU.
L'orchestration de la mémoire : Le CPU agit comme un chef d'orchestre. Il prépare les graphes de calcul, gère la mémoire système (la RAM) et alimente le GPU en données à traiter via Vulkan.
 
Les instructions AVX2 permettent à un processeur de traiter plusieurs blocs de données simultanément au sein d'un même cycle d'horloge (parallélisme SIMD), ce qui accélère drastiquement les tâches d'intelligence artificielle. Votre processeur AMD Ryzen Threadripper 3970X gère nativement et parfaitement ce jeu d'instructions, ce qui vous garantit que la répartition des charges entre votre GPU et votre CPU s'effectue sans goulot d'étranglement majeur.

moyen_moins J'ai un qwen 3.6 35b et un ornith 1.5 35B que je dois tester
Je peux toujours essayer de mettre un qwen 3.8 27b un peu plus gros mais les 10Go de la 6700 sont vite limitant vu que c'est la carte prioritaire (prefill plus intéressant).

 

Je regardais en occase pour au moins 12Go avec préférence 16Go mais les prix aussi c'est encore pire qu'avant...

 

Et en neuf, ma 9060xt a pris 200 balles !  :sweat:

the_fennec

moyen_moins a écrit :

Avant (BC-250 seule, 48K) | Maintenant (2 GPU, 96K)
Contexte 48K | 96K (×2)
Prefill ~100 t/s | 223-248 t/s (×2,2-2,5)  
Génération ~20 t/s | 15,5 t/s (−22 %)
VRAM 6700 — | 9 394 / 10 224 Mo (830 Mo de marge)
GTT BC-250 ~13 Go | 5 513 / 15 709 Mo (10 Go libres !)
Stabilité ✅ ✅ 0 erreur · 0 swap · 0 freeze


 
sur un qwen 3.8 27B gsq rco [:paysan]  
 
je vais tester un MoE mais demain :sleep:
 
edit: la version RX6700XT aurait été mieux, ils manquent ces 2Go de VRAM...
par contre, opencode m'a sauvegardé toutes les aventures pour y arriver :o
 
edit²: ça peak à 400W+ la conso quand même [:totoz]
 
edit^3 : dans la vraie vie => 1 273 tokens, 1min 41s, 12.60 t/s avec recherche internet et contexte 44% sur 98K


 
 
Pas mal :jap:
Mais faut un modèle plus gros, t'as trop de VRAM libre!

the_fennec

tfpsly a écrit :


En tout cas, Qwen3.8-27B-4.2BPW-16GB reste mon favori parmi ceux que j'ai testé : il vient de me créer, puis implémenté, un gros refactoring en 17 étapes sur plusieurs heures. Et ça fonctionne. Content de la qualité et de la vitesse d'exécution sur 5060 Ti 16gb.
Si je suis bien, un Q3 par Unsloth (ou Q3++ si 4.2BPW-16GB est amélioré depuis IQ3_M) donnerait environ 96% de "l'intelligence" du modèle de base, vs 98% pour un Q4 ?

Code :
  1. # 120k context 35 à 40 tk/s (prompt jusque 760 tk/s)
  2. llama-server -m ~/models/Qwen3.8-27B-4.2BPW-16GB.gguf -c 110000 --parallel 1 --no-mmproj-offload -b 512 -ub 512 -ngl 99 --flash-attn on --cache-type-k q4_0 --cache-type-v q4_0 --spec-type draft-mtp --spec-draft-n-max 2 --fit off --reasoning off --reasoning-budget 0 --chat-template-kwargs '{"reasoning_effort":"none"}' --port 8080



 
Je sais pas trop pour l'intelligence, mais désactiver le reasoning ça donne des résultats pas top.
Chez Unlsoth ya le IQ3_S qui est plus petit ou le IQ3_XL qui est plus intelligent.

moyen_moins

Avant (BC-250 seule, 48K) | Maintenant (2 GPU, 96K)
Contexte 48K | 96K (×2)
Prefill ~100 t/s | 223-248 t/s (×2,2-2,5)
Génération ~20 t/s | 15,5 t/s (−22 %)
VRAM 6700 — | 9 394 / 10 224 Mo (830 Mo de marge)
GTT BC-250 ~13 Go | 5 513 / 15 709 Mo (10 Go libres !)
Stabilité ✅ ✅ 0 erreur · 0 swap · 0 freeze

 

sur un qwen 3.8 27B gsq rco [:paysan]

 

je vais tester un MoE mais demain :sleep:

 

edit: la version RX6700XT aurait été mieux, ils manquent ces 2Go de VRAM...
par contre, opencode m'a sauvegardé toutes les aventures pour y arriver :o

 

edit²: ça peak à 400W+ la conso quand même [:totoz]

 

edit^3 : dans la vraie vie => 1 273 tokens, 1min 41s, 12.60 t/s avec recherche internet et contexte 44% sur 98K

moyen_moins

Tronklou a écrit :

Allez on est tous derrière toi  [:phrygide:2]


c'est en cours :o
apparemment, le décodeur vidéo me faisait aussi des misères, il a été désactivé.
avec l'adaptateur occulink, ça a l'air mieux :o
je pense que je finirai plus tard... en tout cas, sur du prefill sur un 9B, c'est x2 vs le bc-250 mais j'ai un souci sur le decode :fou:

 

edit: a priori, réglé (au moins sur le 9B) :o

neo world [:babaji]

Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)