lapin | the_fennec a écrit :
Il n'y a pas de build "llama.cpp-win-x86_64-vulkan-avx2" et LMSTUDIO est closed source (pas tout, mais le UI/moteur n'est pas dispo). LMSTUDIO a son propre build de llama.cpp et il ne correspond pas aux sources officielles. UD3 a été ajouté il y a plus d'un mois, ça devrait marcher depuis le temps.
moyen_moins n'est pas le premier a avoir des soucis avec LMSTUDIO, en tout cas chez moi ça marche 
|
Je n'ai fait que copié coller Manifest JSON depuis Manage depuis Runtime de l'application LM STUDIO.
En tout cas gemini n'est pas d'accord avec tes affirmations comme quoi LM STUDIO serait très en retard de plus d'un moi de Llama.cpp disponible sur Github.
https://share.gemini.google/mHeA8KgJkvd8
Citation :
La release b11189 n'est pas du tout en retard : elle a seulement quelques heures d'écart (ou tout au plus un jour) par rapport à la b11195.
Le projet **llama.cpp** utilise un système d'intégration continue (CI) qui génère automatiquement une nouvelle build numérotée (estampillée `b...`) dès que des commits ou correctifs sont fusionnés sur le dépôt officiel.
Voici la situation exacte :
Écart de builds : seulement 6 numéros de révision d'écart (`b11189` contre `b11195`).
Délai temporel : quelques heures à peine, plusieurs builds étant fréquemment publiées au cours d'une même journée.
Impact pratique : le moteur Vulkan embarqué dans votre version de LM Studio est virtuellement aligné sur la version la plus récente de GitHub. À moins qu'un correctif ultra-spécifique n'ait été poussé dans les toutes dernières heures pour un modèle précis, vous ne manquez aucune fonctionnalité majeure.
---
Vous utilisez donc une version extrêmement récente du moteur, quasiment synchrone avec le développement actif sur GitHub.
|
Actuellement dans LM STUDIO puis dans Configuration puis dans Runtime, puis les trois petis point verticau à droite de Vulkan llama.cpp (Windows) v2.46.0 Vulkan accelerated llama.cpp engine, à Manage Version puisl'icônee qui ressemble à un paragraphe de texte avec pour infobulle View Details For V2.46.0 puis la fenêtre Runtime Details apparait.
J'ai ceci qui s'affiche:
Citation :
Vulkan llama.cpp (Windows): v2.46.0
Vulkan accelerated llama.cpp engine
- llama.cpp release b11189 (commit a25c9865f)
|
Puis ensuite, si je clique sur Manifest JSON il dit ceci:
Citation :
{
"extension_type": "engine",
"domains": [
"llm",
"embedding"
],
"engine": "llama.cpp",
"target_libraries": [
{
"name": "llm_engine_vulkan.node",
"type": "llm_engine",
"version": "0.1.2"
},
{
"name": "liblmstudio_bindings_vulkan.node",
"type": "liblmstudio",
"version": "0.2.26"
}
],
"supported_model_formats": [
"gguf"
],
"engine_protocol_server": {
"runtime_kind": "llama-server",
"executable_relative_path": "llama-server.exe"
},
"name": "llama.cpp-win-x86_64-vulkan-avx2",
"version": "2.46.0",
"platform": "win",
"cpu": {
"architecture": "x86_64",
"instruction_set_extensions": [
"AVX2"
]
},
"gpu": {
"framework": "Vulkan"
},
"manifest_version": "4",
"minimum_lmstudio_version": "0.4.0+15",
"minimum_llmster_version": "0.0.1+9",
"vendor_lib_package_names": [
"win-llama-vulkan-vendor-v2"
]
}
|
Donc je ne fais encore une fois que de faire un copié coller donc pourquoi me dire que , pour un copié collé qui provient de LM STUDIO lui-même !!!??
Gemini dit ceci pour AVX2 sur Llama.cpp: https://share.gemini.google/yvABywV07Idc
Citation :
La désignation `"llama.cpp-win-x86_64-vulkan-avx2"` signifie que le moteur est compilé pour utiliser l'accélération GPU Vulkan, tout en s'assurant que la partie du code exécutée par le processeur (CPU) utilise les instructions optimisées AVX2.
Même lorsque l'API Vulkan est activée pour utiliser la carte graphique, llama.cpp ne transfère jamais 100 % du travail au GPU. Le processeur reste indispensable dans le processus d'inférence pour plusieurs raisons techniques :
Le déchargement partiel (Partial Offloading) : Si les poids d'un modèle d'intelligence artificielle dépassent la capacité de mémoire vidéo disponible (comme les 8 Go de VRAM de votre AMD Radeon RX Vega 56), les couches du modèle qui ne rentrent pas dans la carte graphique sont maintenues et calculées par le processeur. Les instructions AVX2 (Advanced Vector Extensions 2) sont alors cruciales pour que le CPU effectue ces lourds calculs matriciels le plus rapidement possible.
Le repli technique (Fallback) : Le développement du backend Vulkan sur llama.cpp est continu. Si une opération mathématique spécifique (un "op" tensoriel) requise par un modèle n'est pas encore prise en charge par l'API Vulkan, le moteur délègue automatiquement et instantanément ce calcul au processeur.
La tokenisation et le traitement des données : La conversion de votre texte en "tokens" compréhensibles par le modèle au début du prompt, ainsi que le décodage des tokens en texte lisible à la fin, sont des opérations exclusivement gérées par le CPU.
L'orchestration de la mémoire : Le CPU agit comme un chef d'orchestre. Il prépare les graphes de calcul, gère la mémoire système (la RAM) et alimente le GPU en données à traiter via Vulkan.
Les instructions AVX2 permettent à un processeur de traiter plusieurs blocs de données simultanément au sein d'un même cycle d'horloge (parallélisme SIMD), ce qui accélère drastiquement les tâches d'intelligence artificielle. Votre processeur AMD Ryzen Threadripper 3970X gère nativement et parfaitement ce jeu d'instructions, ce qui vous garantit que la répartition des charges entre votre GPU et votre CPU s'effectue sans goulot d'étranglement majeur.
|
|