Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
5521 connectés 

 


Je génère ...


 
8.3 %
 2 votes
1.  moins de 100k tokens par jour
 
 
4.2 %
 1 vote
2.  entre 100k et 500k tokens par jour
 
 
8.3 %
 2 votes
3.  Entre 500 et 1M de tokens par jour
 
 
8.3 %
 2 votes
4.  Entre 1M et 5M de tokens par jour
 
 
4.2 %
 1 vote
5.  5M+
 
 
12.5 %
 3 votes
6.  10M+
 
 
20.8 %
 5 votes
7.  La quantité c'est dans la tête, tout est dans la qualité du jeton
 
 
20.8 %
 5 votes
8.  Quand on aime on ne compte pas (j'en ait aucune idée :o )
 
 
4.2 %
 1 vote
9.  C'est quoi ce token maxing de merde ? je dedrap le topic !
 
 
8.3 %
 2 votes
10.  zero, je lurke et je produis mon token seulement biologiquement
 

Total : 25 votes (1 vote blanc)
Sondage à 3 choix possibles.
Ce sondage est clos, vous ne pouvez plus voter
 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  70  71  72  73  74  75
Page Suivante
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°50784
neo world
Posté le 26-09-2026 à 00:14:23  profilanswer
 

Reprise du message précédent :
 [:babaji]

n°50789
moyen_moin​s
chat réincarné
Posté le 26-09-2026 à 02:28:55  profilanswer
 

Tronklou a écrit :

Allez on est tous derrière toi  [:phrygide:2]


c'est en cours :o
apparemment, le décodeur vidéo me faisait aussi des misères, il a été désactivé.
avec l'adaptateur occulink, ça a l'air mieux :o
je pense que je finirai plus tard... en tout cas, sur du prefill sur un 9B, c'est x2 vs le bc-250 mais j'ai un souci sur le decode :fou:

 

edit: a priori, réglé (au moins sur le 9B) :o


Message édité par moyen_moins le 26-09-2026 à 02:54:41
n°50790
moyen_moin​s
chat réincarné
Posté le 26-09-2026 à 03:15:13  profilanswer
 

Avant (BC-250 seule, 48K) | Maintenant (2 GPU, 96K)
Contexte 48K | 96K (×2)
Prefill ~100 t/s | 223-248 t/s (×2,2-2,5)
Génération ~20 t/s | 15,5 t/s (−22 %)
VRAM 6700 — | 9 394 / 10 224 Mo (830 Mo de marge)
GTT BC-250 ~13 Go | 5 513 / 15 709 Mo (10 Go libres !)
Stabilité ✅ ✅ 0 erreur · 0 swap · 0 freeze

 

sur un qwen 3.8 27B gsq rco [:paysan]

 

je vais tester un MoE mais demain :sleep:

 

edit: la version RX6700XT aurait été mieux, ils manquent ces 2Go de VRAM...
par contre, opencode m'a sauvegardé toutes les aventures pour y arriver :o

 

edit²: ça peak à 400W+ la conso quand même [:totoz]

 

edit^3 : dans la vraie vie => 1 273 tokens, 1min 41s, 12.60 t/s avec recherche internet et contexte 44% sur 98K

Message cité 1 fois
Message édité par moyen_moins le 26-09-2026 à 03:43:32
n°50801
the_fennec
f3nn3cUs z3rd4
Posté le 26-09-2026 à 09:54:55  profilanswer
 

tfpsly a écrit :


En tout cas, Qwen3.8-27B-4.2BPW-16GB reste mon favori parmi ceux que j'ai testé : il vient de me créer, puis implémenté, un gros refactoring en 17 étapes sur plusieurs heures. Et ça fonctionne. Content de la qualité et de la vitesse d'exécution sur 5060 Ti 16gb.
Si je suis bien, un Q3 par Unsloth (ou Q3++ si 4.2BPW-16GB est amélioré depuis IQ3_M) donnerait environ 96% de "l'intelligence" du modèle de base, vs 98% pour un Q4 ?

Code :
  1. # 120k context 35 à 40 tk/s (prompt jusque 760 tk/s)
  2. llama-server -m ~/models/Qwen3.8-27B-4.2BPW-16GB.gguf -c 110000 --parallel 1 --no-mmproj-offload -b 512 -ub 512 -ngl 99 --flash-attn on --cache-type-k q4_0 --cache-type-v q4_0 --spec-type draft-mtp --spec-draft-n-max 2 --fit off --reasoning off --reasoning-budget 0 --chat-template-kwargs '{"reasoning_effort":"none"}' --port 8080



 
Je sais pas trop pour l'intelligence, mais désactiver le reasoning ça donne des résultats pas top.
Chez Unlsoth ya le IQ3_S qui est plus petit ou le IQ3_XL qui est plus intelligent.


---------------
Faudra que je teste un jour :o
n°50802
the_fennec
f3nn3cUs z3rd4
Posté le 26-09-2026 à 10:07:53  profilanswer
 

moyen_moins a écrit :

Avant (BC-250 seule, 48K) | Maintenant (2 GPU, 96K)
Contexte 48K | 96K (×2)
Prefill ~100 t/s | 223-248 t/s (×2,2-2,5)  
Génération ~20 t/s | 15,5 t/s (−22 %)
VRAM 6700 — | 9 394 / 10 224 Mo (830 Mo de marge)
GTT BC-250 ~13 Go | 5 513 / 15 709 Mo (10 Go libres !)
Stabilité ✅ ✅ 0 erreur · 0 swap · 0 freeze


 
sur un qwen 3.8 27B gsq rco [:paysan]  
 
je vais tester un MoE mais demain :sleep:
 
edit: la version RX6700XT aurait été mieux, ils manquent ces 2Go de VRAM...
par contre, opencode m'a sauvegardé toutes les aventures pour y arriver :o
 
edit²: ça peak à 400W+ la conso quand même [:totoz]
 
edit^3 : dans la vraie vie => 1 273 tokens, 1min 41s, 12.60 t/s avec recherche internet et contexte 44% sur 98K


 
 
Pas mal :jap:
Mais faut un modèle plus gros, t'as trop de VRAM libre!


---------------
Faudra que je teste un jour :o
n°50807
moyen_moin​s
chat réincarné
Posté le 26-09-2026 à 10:29:26  profilanswer
 

J'ai un qwen 3.6 35b et un ornith 1.5 35B que je dois tester
Je peux toujours essayer de mettre un qwen 3.8 27b un peu plus gros mais les 10Go de la 6700 sont vite limitant vu que c'est la carte prioritaire (prefill plus intéressant).

 

Je regardais en occase pour au moins 12Go avec préférence 16Go mais les prix aussi c'est encore pire qu'avant...

 

Et en neuf, ma 9060xt a pris 200 balles !  :sweat:

n°50821
lapin
Posté le 26-09-2026 à 11:34:53  profilanswer
 

the_fennec a écrit :


 
 
Il n'y a pas de build "llama.cpp-win-x86_64-vulkan-avx2" et LMSTUDIO est closed source (pas tout, mais le UI/moteur n'est pas dispo). LMSTUDIO a son propre build de llama.cpp et il ne correspond pas aux sources officielles. UD3 a été ajouté il y a plus d'un mois, ça devrait marcher depuis le temps.
 
moyen_moins n'est pas le premier a avoir des soucis avec LMSTUDIO, en tout cas chez moi ça marche :o


 
Je n'ai fait que copié coller Manifest JSON depuis Manage depuis Runtime de l'application LM STUDIO.
 
 
En tout cas gemini n'est pas d'accord avec tes affirmations comme quoi LM STUDIO serait très en retard de plus d'un moi de Llama.cpp disponible sur Github.
 
https://share.gemini.google/mHeA8KgJkvd8
 

Citation :


La release b11189 n'est pas du tout en retard : elle a seulement quelques heures d'écart (ou tout au plus un jour) par rapport à la b11195.
 
Le projet **llama.cpp** utilise un système d'intégration continue (CI) qui génère automatiquement une nouvelle build numérotée (estampillée `b...`) dès que des commits ou correctifs sont fusionnés sur le dépôt officiel.
 
Voici la situation exacte :
 
Écart de builds : seulement 6 numéros de révision d'écart (`b11189` contre `b11195`).
Délai temporel : quelques heures à peine, plusieurs builds étant fréquemment publiées au cours d'une même journée.
Impact pratique : le moteur Vulkan embarqué dans votre version de LM Studio est virtuellement aligné sur la version la plus récente de GitHub. À moins qu'un correctif ultra-spécifique n'ait été poussé dans les toutes dernières heures pour un modèle précis, vous ne manquez aucune fonctionnalité majeure.
 
---
 
Vous utilisez donc une version extrêmement récente du moteur, quasiment synchrone avec le développement actif sur GitHub.
 


 
 
Actuellement dans LM STUDIO puis dans Configuration puis dans Runtime, puis les trois petis point verticau à droite de Vulkan llama.cpp (Windows) v2.46.0 Vulkan accelerated llama.cpp engine, à Manage Version puisl'icônee qui ressemble à un paragraphe de texte avec pour infobulle View Details For V2.46.0 puis la fenêtre Runtime Details apparait.
 
 
 
J'ai ceci qui s'affiche:

Citation :


Vulkan llama.cpp (Windows): v2.46.0
 
Vulkan accelerated llama.cpp engine
 
- llama.cpp release b11189 (commit a25c9865f)


 
 
Puis ensuite, si je clique sur Manifest JSON il dit ceci:
 

Citation :


{
  "extension_type": "engine",
  "domains": [
    "llm",
    "embedding"
  ],
  "engine": "llama.cpp",
  "target_libraries": [
    {
      "name": "llm_engine_vulkan.node",
      "type": "llm_engine",
      "version": "0.1.2"
    },
    {
      "name": "liblmstudio_bindings_vulkan.node",
      "type": "liblmstudio",
      "version": "0.2.26"
    }
  ],
  "supported_model_formats": [
    "gguf"
  ],
  "engine_protocol_server": {
    "runtime_kind": "llama-server",
    "executable_relative_path": "llama-server.exe"
  },
  "name": "llama.cpp-win-x86_64-vulkan-avx2",
  "version": "2.46.0",
  "platform": "win",
  "cpu": {
    "architecture": "x86_64",
    "instruction_set_extensions": [
      "AVX2"
    ]
  },
  "gpu": {
    "framework": "Vulkan"
  },
  "manifest_version": "4",
  "minimum_lmstudio_version": "0.4.0+15",
  "minimum_llmster_version": "0.0.1+9",
  "vendor_lib_package_names": [
    "win-llama-vulkan-vendor-v2"
  ]
}


 
Donc je ne fais encore une fois que de faire un copié coller donc pourquoi me dire que

the_fennec a écrit :

Il n'y a pas de build "llama.cpp-win-x86_64-vulkan-avx2"

, pour un copié collé qui provient de LM STUDIO lui-même !!!??
 
Gemini dit ceci pour AVX2 sur Llama.cpp: https://share.gemini.google/yvABywV07Idc
 
 

Citation :


La désignation `"llama.cpp-win-x86_64-vulkan-avx2"` signifie que le moteur est compilé pour utiliser l'accélération GPU Vulkan, tout en s'assurant que la partie du code exécutée par le processeur (CPU) utilise les instructions optimisées AVX2.
 
Même lorsque l'API Vulkan est activée pour utiliser la carte graphique, llama.cpp ne transfère jamais 100 % du travail au GPU. Le processeur reste indispensable dans le processus d'inférence pour plusieurs raisons techniques :
 
Le déchargement partiel (Partial Offloading) : Si les poids d'un modèle d'intelligence artificielle dépassent la capacité de mémoire vidéo disponible (comme les 8 Go de VRAM de votre AMD Radeon RX Vega 56), les couches du modèle qui ne rentrent pas dans la carte graphique sont maintenues et calculées par le processeur. Les instructions AVX2 (Advanced Vector Extensions 2) sont alors cruciales pour que le CPU effectue ces lourds calculs matriciels le plus rapidement possible.
Le repli technique (Fallback) : Le développement du backend Vulkan sur llama.cpp est continu. Si une opération mathématique spécifique (un "op" tensoriel) requise par un modèle n'est pas encore prise en charge par l'API Vulkan, le moteur délègue automatiquement et instantanément ce calcul au processeur.
La tokenisation et le traitement des données : La conversion de votre texte en "tokens" compréhensibles par le modèle au début du prompt, ainsi que le décodage des tokens en texte lisible à la fin, sont des opérations exclusivement gérées par le CPU.
L'orchestration de la mémoire : Le CPU agit comme un chef d'orchestre. Il prépare les graphes de calcul, gère la mémoire système (la RAM) et alimente le GPU en données à traiter via Vulkan.
 
Les instructions AVX2 permettent à un processeur de traiter plusieurs blocs de données simultanément au sein d'un même cycle d'horloge (parallélisme SIMD), ce qui accélère drastiquement les tâches d'intelligence artificielle. Votre processeur AMD Ryzen Threadripper 3970X gère nativement et parfaitement ce jeu d'instructions, ce qui vous garantit que la répartition des charges entre votre GPU et votre CPU s'effectue sans goulot d'étranglement majeur.

Message cité 1 fois
Message édité par lapin le 26-09-2026 à 11:36:01
n°50826
the_fennec
f3nn3cUs z3rd4
Posté le 26-09-2026 à 11:43:50  profilanswer
 

moyen_moins a écrit :

J'ai un qwen 3.6 35b et un ornith 1.5 35B que je dois tester
Je peux toujours essayer de mettre un qwen 3.8 27b un peu plus gros mais les 10Go de la 6700 sont vite limitant vu que c'est la carte prioritaire (prefill plus intéressant).
 
Je regardais en occase pour au moins 12Go avec préférence 16Go mais les prix aussi c'est encore pire qu'avant...
 
Et en neuf, ma 9060xt a pris 200 balles !  :sweat:


 
c'est dommage de pas profiter des 20GB+ de ta config, il faut que tu essayes en split tensor aussi.


---------------
Faudra que je teste un jour :o
n°50830
the_fennec
f3nn3cUs z3rd4
Posté le 26-09-2026 à 11:52:02  profilanswer
 

lapin a écrit :

Je n'ai fait que copié coller ... gemini


 
J'utilise pas LMSudio, si un truc marche pas dessus BALEC. C'est juste un soft parasite comme Ollama qui essaye de faire du pognon sur llama.cpp sans contribuer en retour.


---------------
Faudra que je teste un jour :o
n°50831
lapin
Posté le 26-09-2026 à 12:00:31  profilanswer
 

the_fennec a écrit :


 

lapin a écrit :

Je n'ai fait que copié coller ... gemini


 
J'utilise pas LMSudio, si un truc marche pas dessus BALEC. C'est juste un soft parasite comme Ollama qui essaye de faire du pognon sur llama.cpp sans contribuer en retour.


 
Ah oui, carrément, tu ne lis pas, autant ne pas, je ne te parlerais plus et en plus en me quotant tu déformes mes propos au moment du quote en supprimant une partie de mon texte dans le but de me décrédibilisé, bravo à toi !!!!
 
 

n°50845
lapin
Posté le 26-09-2026 à 13:13:32  profilanswer
 

eisfrosch : L'état chaotique de la programmation sur GPU
https://www.youtube.com/watch?v=9-DiGrnz8l8
 
Par contre le Youtber bien que Français parle en Anglais et y a pas de Traduction.

n°50857
moyen_moin​s
chat réincarné
Posté le 26-09-2026 à 13:52:25  profilanswer
 

the_fennec a écrit :

 

c'est dommage de pas profiter des 20GB+ de ta config, il faut que tu essayes en split tensor aussi.


J'ai lancé les tests sur 2 iq4_xs, je vais bien voir.
Faudrait que je tente aussi un Qwen 3.8 légèrement plus gros.

 

le ornith 1.5 en iq4_xs passe, 256k de contexte en kv q8/q4. par contre, sur la conso, on sent que la RX6700 est moins "utilisée" avec la répartition des layers qui est plus orienté sur le bc-250.

 

edit: le qwen 3.6 35B passe en iq4_xs mais celui que j'ai choisis, je le trouve moins bon que le ornith [:paysan] (même contexte/kv cache)


Message édité par moyen_moins le 26-09-2026 à 14:27:59
 Page :   1  2  3  4  5  ..  70  71  72  73  74  75
Page Suivante

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)