Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
6444 connectés 

 


Je génère ...


 
8.3 %
 2 votes
1.  moins de 100k tokens par jour
 
 
4.2 %
 1 vote
2.  entre 100k et 500k tokens par jour
 
 
8.3 %
 2 votes
3.  Entre 500 et 1M de tokens par jour
 
 
8.3 %
 2 votes
4.  Entre 1M et 5M de tokens par jour
 
 
4.2 %
 1 vote
5.  5M+
 
 
12.5 %
 3 votes
6.  10M+
 
 
20.8 %
 5 votes
7.  La quantité c'est dans la tête, tout est dans la qualité du jeton
 
 
20.8 %
 5 votes
8.  Quand on aime on ne compte pas (j'en ait aucune idée :o )
 
 
4.2 %
 1 vote
9.  C'est quoi ce token maxing de merde ? je dedrap le topic !
 
 
8.3 %
 2 votes
10.  zero, je lurke et je produis mon token seulement biologiquement
 

Total : 25 votes (1 vote blanc)
Sondage à 3 choix possibles.
Ce sondage est clos, vous ne pouvez plus voter
 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  15  16  17  ..  67  68  69  70  71  72
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°39094
jojo_le_ha​ricot
Posté le 12-06-2026 à 23:08:59  profilanswer
 

Reprise du message précédent :

neo world a écrit :


M2 + oculink pour récupérer 4 liens PCI express tout frais :D


 
[:billy-bob jambonbeur]


---------------

n°39095
croustx
Modoadorateur
Posté le 12-06-2026 à 23:09:06  profilanswer
 

neo world a écrit :


y'a pas de raison. Tu dois avoir une erreur de config dans l'URL / modèle. Tu le charges en just in time ?
 
sinon heretic marche bien chez moi aussi :jap:


 
Je fais tout simplement :
 
ollama launch openclaw --model fredrezones55/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive:Q4 --yes

n°39097
neo world
Posté le 12-06-2026 à 23:16:57  profilanswer
 

je sais pas du tout comment ça tourne ollama mais c'est chelou de lui faire lancer openclaw (j'aurais plutôt fait le openclaw onboard pour lui donner le endpoint local)
 
tu as essayé de lui envoyer une question via curl ou un client web (genre open webui, llama swap ou lemonade ou ..) pour voir si le modèle était bien operationnel ?


Message édité par neo world le 12-06-2026 à 23:56:11
n°39151
the_fennec
f3nn3cUs z3rd4
Posté le 13-06-2026 à 09:50:18  profilanswer
 

jojo_le_haricot a écrit :


 
En fait il semblerait que le problème ne vienne pas de --n-cpu-moe car même quand je ne l'utilise pas ça merde quand j'utilise --tensor-split
 
Cette config fonctionne :

Code :
  1. --ctx-size 131077 ^
  2. --fit on


 
Celle-ci non (quelles que soient les valeurs pour tensor-split) :

Code :
  1. --ctx-size 131077 ^
  2. --tensor-split 21,20^
  3. --fit off


 
https://rehost.diberie.com/Picture/Get/f/521034


 
C'est normal, ton modèle fait 32Go, donc avec 21/20 il essaye de mettre 17Go sur une carte et 15Go sur l'autre, ça marche pas pour deux cartes a 12Go :o
 
Il faut que tu fasses le calcul pour mettre 24Go de modèle dans tes deux GPU et le reste en RAM, en tenant compte du fait que tu as 42 layers.
 
Essaye ça pour voir:
 

Code :
  1. --ctx-size 131077 ^
  2. --n-cpu-moe 12 ^
  3. --tensor-split 15,15^
  4. --fit off


 
Si ça marche pas, essayer de mettre 14,14 et 14.  
 
Tu vois la répartition qu'il va mettre dans ce log (je suis en Vulkan, tu devrais avoir CUDA a la place), si tu vois pas le message, ajoute -lv 4 pour avoir plus de logs:
 

Code :
  1. 0.02.461.023 I load_tensors: offloading output layer to GPU
  2. 0.02.461.030 I load_tensors: offloading 63 repeating layers to GPU
  3. 0.02.461.031 I load_tensors: offloaded 65/65 layers to GPU
  4. 0.02.461.037 I load_tensors: RPC0[192.168.0.40:50000] model buffer size = 11576.25 MiB
  5. 0.02.461.039 I load_tensors:      Vulkan0 model buffer size = 14396.03 MiB
  6. 0.02.461.040 I load_tensors:  Vulkan_Host model buffer size =  1288.28 MiB


 
Fais aussi attention aux applis qui utilisent ton GPU et prennent de la VRAM, genre un browser ou des GUI divers. Tu peux utiliser System Informer pour voir quel process prennent de la VRAM.
https://github.com/winsiderss/systeminformer

Message cité 1 fois
Message édité par the_fennec le 13-06-2026 à 09:58:46

---------------
Faudra que je teste un jour :o
n°39152
the_fennec
f3nn3cUs z3rd4
Posté le 13-06-2026 à 09:54:17  profilanswer
 

croustx a écrit :


 
Je fais tout simplement :
 
ollama launch openclaw --model fredrezones55/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive:Q4 --yes


 
Pareil que neo world, j'utilise pas ollama, llama.cpp c'est mieux.
 
T'as des logs?
Généralement quand un LLM réponds pas c'est qu'on lui passe pas le bon non de modèle, c'est pour ça que j'utilise un "-alias default" comme ça mon modèle s'appelle "default" quelque soit celui que je charge. Mais j'imagine que ollama doit le faire tout seul.
 
Essaye avec llama.cpp et une install de Openclaw peut être.

Message cité 1 fois
Message édité par the_fennec le 13-06-2026 à 09:56:39

---------------
Faudra que je teste un jour :o
n°39193
jojo_le_ha​ricot
Posté le 13-06-2026 à 11:21:34  profilanswer
 

the_fennec a écrit :


 
C'est normal, ton modèle fait 32Go, donc avec 21/20 il essaye de mettre 17Go sur une carte et 15Go sur l'autre, ça marche pas pour deux cartes a 12Go :o
 
Il faut que tu fasses le calcul pour mettre 24Go de modèle dans tes deux GPU et le reste en RAM, en tenant compte du fait que tu as 42 layers.
 
Essaye ça pour voir:
 

Code :
  1. --ctx-size 131077 ^
  2. --n-cpu-moe 12 ^
  3. --tensor-split 15,15^
  4. --fit off


 
Si ça marche pas, essayer de mettre 14,14 et 14.  
 
Tu vois la répartition qu'il va mettre dans ce log (je suis en Vulkan, tu devrais avoir CUDA a la place), si tu vois pas le message, ajoute -lv 4 pour avoir plus de logs:
 

Code :
  1. 0.02.461.023 I load_tensors: offloading output layer to GPU
  2. 0.02.461.030 I load_tensors: offloading 63 repeating layers to GPU
  3. 0.02.461.031 I load_tensors: offloaded 65/65 layers to GPU
  4. 0.02.461.037 I load_tensors: RPC0[192.168.0.40:50000] model buffer size = 11576.25 MiB
  5. 0.02.461.039 I load_tensors:      Vulkan0 model buffer size = 14396.03 MiB
  6. 0.02.461.040 I load_tensors:  Vulkan_Host model buffer size =  1288.28 MiB


 
Fais aussi attention aux applis qui utilisent ton GPU et prennent de la VRAM, genre un browser ou des GUI divers. Tu peux utiliser System Informer pour voir quel process prennent de la VRAM.
https://github.com/winsiderss/systeminformer


 
Merci pour ton aide.  :)  
 
La premiere conf qui fonctionne c'est ça :

Code :
  1. --ctx-size 131077 ^
  2.   --n-cpu-moe 28 ^
  3.   --tensor-split 7,7 ^
  4.   --fit off ^


Le log :

Code :
  1. 0.08.724.700 I load_tensors: offloading output layer to GPU
  2. 0.08.724.708 I load_tensors: offloading 39 repeating layers to GPU
  3. 0.08.724.709 I load_tensors: offloaded 41/41 layers to GPU
  4. 0.08.724.715 I load_tensors:        CUDA0 model buffer size =   801.58 MiB
  5. 0.08.724.717 I load_tensors:        CUDA1 model buffer size =  9541.22 MiB
  6. 0.08.724.718 I load_tensors:          CPU model buffer size = 20015.31 MiB


Clairement pas bien réparti entre les 2 GPU...
 
 
Si je mets  

Code :
  1. --ctx-size 131077 ^
  2.   --n-cpu-moe 26 ^
  3.   --tensor-split 8,8 ^
  4.   --fit off ^


J'obtiens ceci :

Code :
  1. 0.08.198.211 I load_tensors: offloading output layer to GPU
  2. 0.08.198.217 I load_tensors: offloading 39 repeating layers to GPU
  3. 0.08.198.218 I load_tensors: offloaded 41/41 layers to GPU
  4. 0.08.198.224 I load_tensors:        CUDA0 model buffer size =   801.58 MiB
  5. 0.08.198.226 I load_tensors:        CUDA1 model buffer size = 10925.22 MiB
  6. 0.08.198.228 I load_tensors:          CPU model buffer size = 18631.31 MiB
  7. ...
  8. 0.29.616.663 E ggml_backend_cuda_buffer_type_alloc_buffer: allocating 681.33 MiB on device 1: cudaMalloc failed: out of memory
  9. 0.29.616.672 E alloc_tensor_range: failed to allocate CUDA1 buffer of size 714424320
  10. 0.29.625.458 E llama_init_from_model: failed to initialize the context: failed to allocate buffer for kv cache
  11. 0.29.625.463 E common_init_result: failed to create context with model 'C:\IA\models\Qwen3.6-35B-A3B-UD-Q6_K_XL.gguf'
  12. 0.29.625.465 E common_init_from_params: failed to create context with model 'C:\IA\models\Qwen3.6-35B-A3B-UD-Q6_K_XL.gguf'


---------------

n°39195
the_fennec
f3nn3cUs z3rd4
Posté le 13-06-2026 à 11:39:44  profilanswer
 

C'est bien deux 3060 12Go que tu as?
Vérifie avec GPU-Z
 
Ou bien c'est indiqué au début dans les logs. C'est vraiment étrange qu'il mette rien sur le CUDA0.
T'aurais pas un iGPU en plus?
 
Tu peux poster un log complet?


---------------
Faudra que je teste un jour :o
n°39202
the_fennec
f3nn3cUs z3rd4
Posté le 13-06-2026 à 11:54:14  profilanswer
 

Bon, c'est trop cool tout en Vulkan :D
 
En ajoutant --direct-io ça charge le modèle plus vite, c'est pas au niveau de CUDA, mais c'est mieux que rien. J'ai des perf bien plus stables, la je me suis mis en 27B Q6 MTP et je fais du 100/s en pp et 10/s en tg/s.


---------------
Faudra que je teste un jour :o
n°39204
the_fennec
f3nn3cUs z3rd4
Posté le 13-06-2026 à 11:56:21  profilanswer
 

Google DiffusionGemma running at 4x faster text generation!
https://www.reddit.com/r/unsloth/co [...] ster_text/
 
Marrant de voir la génération!
 
Diffusion Gemma is 4x faster, but makes 6x more mistakes!
https://www.reddit.com/r/LocalLLaMA [...] s_6x_more/
 
Décidément, Google est le roi du pétard mouillé :(


---------------
Faudra que je teste un jour :o
n°39216
jojo_le_ha​ricot
Posté le 13-06-2026 à 12:20:00  profilanswer
 

the_fennec a écrit :

C'est bien deux 3060 12Go que tu as?
Vérifie avec GPU-Z
 
Ou bien c'est indiqué au début dans les logs. C'est vraiment étrange qu'il mette rien sur le CUDA0.
T'aurais pas un iGPU en plus?
 
Tu peux poster un log complet?


 
Oui c'est bien deux 3060 12Go aucun doute la dessus.
Pas de iGPU puisque je tourne avec un ryzen 3900x
 
Voici le log complet pour la conf
  --ctx-size 131077 ^
  --n-cpu-moe 28 ^
  --tensor-split 7,7 ^
  --fit off  
 

Code :
  1. 0.00.098.922 I common_params_print_info: build 9608 (70b54e140) with Clang 20.1.8 for Windows x86_64
  2. 0.00.098.926 I log_info: verbosity = 4 (adjust with the `-lv N` CLI arg)
  3. 0.00.098.926 I device_info:
  4. 0.00.182.318 I   - CUDA0   : NVIDIA GeForce RTX 3060 (12287 MiB, 11255 MiB free)
  5. 0.00.264.767 I   - CUDA1   : NVIDIA GeForce RTX 3060 (12287 MiB, 11255 MiB free)
  6. 0.00.264.776 I   - CPU     : AMD Ryzen 9 3900X 12-Core Processor             (49070 MiB, 43661 MiB free)
  7. 0.00.264.838 I system_info: n_threads = 12 (n_threads_batch = 12) / 24 | CUDA : ARCHS = 750,800,860,890,900,1200,1210 | USE_GRAPHS = 1 | PEER_MAX_BATCH_SIZE = 128 | CPU : SSE3 = 1 | SSSE3 = 1 | AVX = 1 | AVX2 = 1 | F16C = 1 | FMA = 1 | BMI2 = 1 | LLAMAFILE = 1 | OPENMP = 1 | REPACK = 1 |
  8. 0.00.264.879 I srv          init: running without SSL
  9. 0.00.264.903 I srv          init: using 23 threads for HTTP server
  10. 0.00.265.026 I srv         start: binding port with default address family
  11. 0.00.279.025 I srv  llama_server: loading model
  12. 0.00.279.038 I srv    load_model: loading model 'C:\IA\models\Qwen3.6-35B-A3B-UD-Q6_K_XL.gguf'
  13. 0.00.348.959 I llama_model_loader: loaded meta data with 54 key-value pairs and 733 tensors from C:\IA\models\Qwen3.6-35B-A3B-UD-Q6_K_XL.gguf (version GGUF V3 (latest))
  14. 0.00.348.979 I llama_model_loader: Dumping metadata keys/values. Note: KV overrides do not apply in this output.
  15. 0.00.348.985 I llama_model_loader: - kv   0:                       general.architecture str              = qwen35moe
  16. 0.00.348.986 I llama_model_loader: - kv   1:                               general.type str              = model
  17. 0.00.348.990 I llama_model_loader: - kv   2:                     general.sampling.top_k i32              = 20
  18. 0.00.348.995 I llama_model_loader: - kv   3:                     general.sampling.top_p f32              = 0.950000
  19. 0.00.348.997 I llama_model_loader: - kv   4:                      general.sampling.temp f32              = 1.000000
  20. 0.00.348.997 I llama_model_loader: - kv   5:                               general.name str              = Qwen3.6-35B-A3B
  21. 0.00.348.998 I llama_model_loader: - kv   6:                           general.basename str              = Qwen3.6-35B-A3B
  22. 0.00.348.999 I llama_model_loader: - kv   7:                       general.quantized_by str              = Unsloth
  23. 0.00.348.999 I llama_model_loader: - kv   8:                         general.size_label str              = 35B-A3B
  24. 0.00.349.000 I llama_model_loader: - kv   9:                            general.license str              = apache-2.0
  25. 0.00.349.003 I llama_model_loader: - kv  10:                       general.license.link str              = https://huggingface.co/Qwen/Qwen3.6-3...
  26. 0.00.349.004 I llama_model_loader: - kv  11:                           general.repo_url str              = https://huggingface.co/unsloth
  27. 0.00.349.006 I llama_model_loader: - kv  12:                   general.base_model.count u32              = 1
  28. 0.00.349.007 I llama_model_loader: - kv  13:                  general.base_model.0.name str              = Qwen3.6 35B A3B
  29. 0.00.349.007 I llama_model_loader: - kv  14:          general.base_model.0.organization str              = Qwen
  30. 0.00.349.009 I llama_model_loader: - kv  15:              general.base_model.0.repo_url str              = https://huggingface.co/Qwen/Qwen3.6-3...
  31. 0.00.349.025 I llama_model_loader: - kv  16:                               general.tags arr[str,3]       = ["qwen3_5_moe", "qwen", "image-text-t...
  32. 0.00.349.026 I llama_model_loader: - kv  17:                      qwen35moe.block_count u32              = 40
  33. 0.00.349.027 I llama_model_loader: - kv  18:                   qwen35moe.context_length u32              = 262144
  34. 0.00.349.027 I llama_model_loader: - kv  19:                 qwen35moe.embedding_length u32              = 2048
  35. 0.00.349.028 I llama_model_loader: - kv  20:             qwen35moe.attention.head_count u32              = 16
  36. 0.00.349.028 I llama_model_loader: - kv  21:          qwen35moe.attention.head_count_kv u32              = 2
  37. 0.00.349.031 I llama_model_loader: - kv  22:          qwen35moe.rope.dimension_sections arr[i32,4]       = [11, 11, 10, 0]
  38. 0.00.349.032 I llama_model_loader: - kv  23:                   qwen35moe.rope.freq_base f32              = 10000000.000000
  39. 0.00.349.034 I llama_model_loader: - kv  24: qwen35moe.attention.layer_norm_rms_epsilon f32              = 0.000001
  40. 0.00.349.035 I llama_model_loader: - kv  25:                     qwen35moe.expert_count u32              = 256
  41. 0.00.349.036 I llama_model_loader: - kv  26:                qwen35moe.expert_used_count u32              = 8
  42. 0.00.349.036 I llama_model_loader: - kv  27:             qwen35moe.attention.key_length u32              = 256
  43. 0.00.349.037 I llama_model_loader: - kv  28:           qwen35moe.attention.value_length u32              = 256
  44. 0.00.349.038 I llama_model_loader: - kv  29:       qwen35moe.expert_feed_forward_length u32              = 512
  45. 0.00.349.038 I llama_model_loader: - kv  30: qwen35moe.expert_shared_feed_forward_length u32              = 512
  46. 0.00.349.039 I llama_model_loader: - kv  31:                  qwen35moe.ssm.conv_kernel u32              = 4
  47. 0.00.349.039 I llama_model_loader: - kv  32:                   qwen35moe.ssm.state_size u32              = 128
  48. 0.00.349.040 I llama_model_loader: - kv  33:                  qwen35moe.ssm.group_count u32              = 16
  49. 0.00.349.041 I llama_model_loader: - kv  34:               qwen35moe.ssm.time_step_rank u32              = 32
  50. 0.00.349.041 I llama_model_loader: - kv  35:                   qwen35moe.ssm.inner_size u32              = 4096
  51. 0.00.349.042 I llama_model_loader: - kv  36:          qwen35moe.full_attention_interval u32              = 4
  52. 0.00.349.042 I llama_model_loader: - kv  37:             qwen35moe.rope.dimension_count u32              = 64
  53. 0.00.349.043 I llama_model_loader: - kv  38:                       tokenizer.ggml.model str              = gpt2
  54. 0.00.349.044 I llama_model_loader: - kv  39:                         tokenizer.ggml.pre str              = qwen35
  55. 0.00.414.143 I llama_model_loader: - kv  40:                      tokenizer.ggml.tokens arr[str,248320]  = ["!", "\"", "#", "$", "%", "&", "'", ...
  56. 0.00.438.893 I llama_model_loader: - kv  41:                  tokenizer.ggml.token_type arr[i32,248320]  = [1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, ...
  57. 0.00.506.389 I llama_model_loader: - kv  42:                      tokenizer.ggml.merges arr[str,247587]  = ["Ġ Ġ", "ĠĠ ĠĠ", "i n", "Ġ t",...
  58. 0.00.506.395 I llama_model_loader: - kv  43:                tokenizer.ggml.eos_token_id u32              = 248046
  59. 0.00.506.396 I llama_model_loader: - kv  44:            tokenizer.ggml.padding_token_id u32              = 248055
  60. 0.00.506.398 I llama_model_loader: - kv  45:                tokenizer.ggml.bos_token_id u32              = 248044
  61. 0.00.506.399 I llama_model_loader: - kv  46:               tokenizer.ggml.add_bos_token bool             = false
  62. 0.00.506.406 I llama_model_loader: - kv  47:                    tokenizer.chat_template str              = {%- set image_count = namespace(value...
  63. 0.00.506.407 I llama_model_loader: - kv  48:               general.quantization_version u32              = 2
  64. 0.00.506.408 I llama_model_loader: - kv  49:                          general.file_type u32              = 18
  65. 0.00.506.410 I llama_model_loader: - kv  50:                      quantize.imatrix.file str              = Qwen3.6-35B-A3B-GGUF/imatrix_unsloth....
  66. 0.00.506.411 I llama_model_loader: - kv  51:                   quantize.imatrix.dataset str              = unsloth_calibration_Qwen3.6-35B-A3B.txt
  67. 0.00.506.412 I llama_model_loader: - kv  52:             quantize.imatrix.entries_count u32              = 510
  68. 0.00.506.413 I llama_model_loader: - kv  53:              quantize.imatrix.chunks_count u32              = 76
  69. 0.00.506.420 I llama_model_loader: - type  f32:  361 tensors
  70. 0.00.506.421 I llama_model_loader: - type q8_0:  294 tensors
  71. 0.00.506.421 I llama_model_loader: - type q6_K:   78 tensors
  72. 0.00.506.424 I print_info: file format = GGUF V3 (latest)
  73. 0.00.506.425 I print_info: file type   = Q6_K
  74. 0.00.506.428 I print_info: file size   = 29.65 GiB (7.35 BPW)
  75. 0.00.796.631 I llama_prepare_model_devices: using device CUDA0 (NVIDIA GeForce RTX 3060) (0000:03:00.0) - 11255 MiB free
  76. 0.00.868.915 I llama_prepare_model_devices: using device CUDA1 (NVIDIA GeForce RTX 3060) (0000:06:00.0) - 11255 MiB free
  77. 0.00.993.882 I load: 0 unused tokens
  78. 0.01.038.091 I load: printing all EOG tokens:
  79. 0.01.038.098 I load:   - 248044 ('<|endoftext|>')
  80. 0.01.038.099 I load:   - 248046 ('<|im_end|>')
  81. 0.01.038.099 I load:   - 248063 ('<|fim_pad|>')
  82. 0.01.038.099 I load:   - 248064 ('<|repo_name|>')
  83. 0.01.038.100 I load:   - 248065 ('<|file_sep|>')
  84. 0.01.038.549 I load: special tokens cache size = 33
  85. 0.01.092.185 I load: token to piece cache size = 1.7581 MB
  86. 0.01.092.584 I print_info: arch                  = qwen35moe
  87. 0.01.092.587 I print_info: vocab_only            = 0
  88. 0.01.092.588 I print_info: no_alloc              = 0
  89. 0.01.092.589 I print_info: n_ctx_train           = 262144
  90. 0.01.092.590 I print_info: n_embd_inp            = 2048
  91. 0.01.092.590 I print_info: n_embd                = 2048
  92. 0.01.092.592 I print_info: n_embd_out            = 2048
  93. 0.01.092.592 I print_info: n_layer               = 40
  94. 0.01.092.593 I print_info: n_layer_all           = 40
  95. 0.01.092.608 I print_info: n_head                = 16
  96. 0.01.092.610 I print_info: n_head_kv             = 2
  97. 0.01.092.611 I print_info: n_rot                 = 64
  98. 0.01.092.611 I print_info: n_swa                 = 0
  99. 0.01.092.612 I print_info: is_swa_any            = 0
  100. 0.01.092.612 I print_info: n_embd_head_k         = 256
  101. 0.01.092.613 I print_info: n_embd_head_v         = 256
  102. 0.01.092.615 I print_info: n_gqa                 = 8
  103. 0.01.092.617 I print_info: n_embd_k_gqa          = 512
  104. 0.01.092.619 I print_info: n_embd_v_gqa          = 512
  105. 0.01.092.620 I print_info: f_norm_eps            = 0.0e+00
  106. 0.01.092.622 I print_info: f_norm_rms_eps        = 1.0e-06
  107. 0.01.092.622 I print_info: f_clamp_kqv           = 0.0e+00
  108. 0.01.092.623 I print_info: f_max_alibi_bias      = 0.0e+00
  109. 0.01.092.623 I print_info: f_logit_scale         = 0.0e+00
  110. 0.01.092.624 I print_info: f_attn_scale          = 0.0e+00
  111. 0.01.092.625 I print_info: f_attn_value_scale    = 0.0000
  112. 0.01.092.627 I print_info: n_ff                  = 0
  113. 0.01.092.629 I print_info: n_expert              = 256
  114. 0.01.092.629 I print_info: n_expert_used         = 8
  115. 0.01.092.629 I print_info: n_expert_groups       = 0
  116. 0.01.092.630 I print_info: n_group_used          = 0
  117. 0.01.092.631 I print_info: causal attn           = 1
  118. 0.01.092.631 I print_info: pooling type          = -1
  119. 0.01.092.632 I print_info: rope type             = 40
  120. 0.01.092.632 I print_info: rope scaling          = linear
  121. 0.01.092.633 I print_info: freq_base_train       = 10000000.0
  122. 0.01.092.635 I print_info: freq_scale_train      = 1
  123. 0.01.092.635 I print_info: n_ctx_orig_yarn       = 262144
  124. 0.01.092.636 I print_info: rope_yarn_log_mul     = 0.0000
  125. 0.01.092.637 I print_info: rope_finetuned        = unknown
  126. 0.01.092.637 I print_info: mrope sections        = [11, 11, 10, 0]
  127. 0.01.092.638 I print_info: ssm_d_conv            = 4
  128. 0.01.092.638 I print_info: ssm_d_inner           = 4096
  129. 0.01.092.638 I print_info: ssm_d_state           = 128
  130. 0.01.092.639 I print_info: ssm_dt_rank           = 32
  131. 0.01.092.639 I print_info: ssm_n_group           = 16
  132. 0.01.092.640 I print_info: ssm_dt_b_c_rms        = 0
  133. 0.01.092.641 I print_info: model type            = 35B.A3B
  134. 0.01.092.642 I print_info: model params          = 34.66 B
  135. 0.01.092.642 I print_info: general.name          = Qwen3.6-35B-A3B
  136. 0.01.092.643 I print_info: vocab type            = BPE
  137. 0.01.092.644 I print_info: n_vocab               = 248320
  138. 0.01.092.644 I print_info: n_merges              = 247587
  139. 0.01.092.645 I print_info: BOS token             = 248044 '<|endoftext|>'
  140. 0.01.092.645 I print_info: EOS token             = 248046 '<|im_end|>'
  141. 0.01.092.646 I print_info: EOT token             = 248046 '<|im_end|>'
  142. 0.01.092.647 I print_info: PAD token             = 248055 '<|vision_pad|>'
  143. 0.01.092.647 I print_info: LF token              = 198 'Ċ'
  144. 0.01.092.648 I print_info: FIM PRE token         = 248060 '<|fim_prefix|>'
  145. 0.01.092.648 I print_info: FIM SUF token         = 248062 '<|fim_suffix|>'
  146. 0.01.092.649 I print_info: FIM MID token         = 248061 '<|fim_middle|>'
  147. 0.01.092.649 I print_info: FIM PAD token         = 248063 '<|fim_pad|>'
  148. 0.01.092.650 I print_info: FIM REP token         = 248064 '<|repo_name|>'
  149. 0.01.092.650 I print_info: FIM SEP token         = 248065 '<|file_sep|>'
  150. 0.01.092.651 I print_info: EOG token             = 248044 '<|endoftext|>'
  151. 0.01.092.652 I print_info: EOG token             = 248046 '<|im_end|>'
  152. 0.01.092.652 I print_info: EOG token             = 248063 '<|fim_pad|>'
  153. 0.01.092.653 I print_info: EOG token             = 248064 '<|repo_name|>'
  154. 0.01.092.653 I print_info: EOG token             = 248065 '<|file_sep|>'
  155. 0.01.092.654 I print_info: max token length      = 256
  156. 0.01.092.655 I load_tensors: loading model tensors, this can take a while... (mmap = false, direct_io = false)
  157. 0.08.790.935 I load_tensors: offloading output layer to GPU
  158. 0.08.790.941 I load_tensors: offloading 39 repeating layers to GPU
  159. 0.08.790.942 I load_tensors: offloaded 41/41 layers to GPU
  160. 0.08.790.950 I load_tensors:        CUDA0 model buffer size =   801.58 MiB
  161. 0.08.790.951 I load_tensors:        CUDA1 model buffer size =  9541.22 MiB
  162. 0.08.790.953 I load_tensors:          CPU model buffer size = 20015.31 MiB
  163. ...................................................................................................
  164. 0.28.912.548 I common_init_result: added <|endoftext|> logit bias = -inf
  165. 0.28.912.553 I common_init_result: added <|im_end|> logit bias = -inf
  166. 0.28.912.554 I common_init_result: added <|fim_pad|> logit bias = -inf
  167. 0.28.912.555 I common_init_result: added <|repo_name|> logit bias = -inf
  168. 0.28.912.556 I common_init_result: added <|file_sep|> logit bias = -inf
  169. 0.28.914.379 I llama_context: constructing llama_context
  170. 0.28.914.386 I llama_context: n_seq_max     = 1
  171. 0.28.914.386 I llama_context: n_ctx         = 131328
  172. 0.28.914.387 I llama_context: n_ctx_seq     = 131328
  173. 0.28.914.388 I llama_context: n_batch       = 2048
  174. 0.28.914.388 I llama_context: n_ubatch      = 512
  175. 0.28.914.389 I llama_context: causal_attn   = 1
  176. 0.28.914.390 I llama_context: flash_attn    = enabled
  177. 0.28.914.391 I llama_context: kv_unified    = false
  178. 0.28.914.394 I llama_context: freq_base     = 10000000.0
  179. 0.28.914.396 I llama_context: freq_scale    = 1
  180. 0.28.914.397 I llama_context: n_rs_seq      = 0
  181. 0.28.914.398 I llama_context: n_outputs_max = 1
  182. 0.28.914.399 W llama_context: n_ctx_seq (131328) < n_ctx_train (262144) -- the full capacity of the model will not be utilized
  183. 0.28.915.225 I llama_context:  CUDA_Host  output buffer size =     0.95 MiB
  184. 0.28.918.310 I llama_kv_cache:      CUDA0 KV buffer size =   681.33 MiB
  185. 0.29.037.014 I llama_kv_cache:      CUDA1 KV buffer size =   681.33 MiB
  186. 0.29.144.941 I llama_kv_cache: size = 1362.66 MiB (131328 cells,  10 layers,  1/1 seqs), K (q8_0):  681.33 MiB, V (q8_0):  681.33 MiB
  187. 0.29.144.950 I llama_kv_cache: attn_rot_k = 1, n_embd_head_k_all = 256
  188. 0.29.144.951 I llama_kv_cache: attn_rot_v = 1, n_embd_head_k_all = 256
  189. 0.29.154.609 I llama_memory_recurrent:      CUDA0 RS buffer size =    33.50 MiB
  190. 0.29.161.469 I llama_memory_recurrent:      CUDA1 RS buffer size =    29.31 MiB
  191. 0.29.161.479 I llama_memory_recurrent: size =   62.81 MiB (     1 cells,  40 layers,  1 seqs  0 rs_seq), R (f32):    2.81 MiB, S (f32):   60.00 MiB
  192. 0.29.161.488 I sched_reserve: reserving ...
  193. 0.29.166.137 I sched_reserve: resolving fused Gated Delta Net support:
  194. 0.29.170.463 I sched_reserve: fused Gated Delta Net (autoregressive) enabled
  195. 0.29.171.708 I sched_reserve: fused Gated Delta Net (chunked) enabled
  196. 0.29.204.094 I sched_reserve:      CUDA0 compute buffer size =   689.25 MiB
  197. 0.29.204.099 I sched_reserve:      CUDA1 compute buffer size =   437.03 MiB
  198. 0.29.204.100 I sched_reserve:  CUDA_Host compute buffer size =   136.53 MiB
  199. 0.29.204.101 I sched_reserve: graph nodes  = 3847
  200. 0.29.204.104 I sched_reserve: graph splits = 94 (with bs=512), 59 (with bs=1)
  201. 0.29.204.105 I sched_reserve: reserve took 42.61 ms, sched copies = 1
  202. 0.29.204.777 I common_init_from_params: warming up the model with an empty run - please wait ... (--no-warmup to disable)
  203. 0.29.836.639 I srv    load_model: initializing slots, n_slots = 1
  204. 0.30.031.127 I common_context_can_seq_rm: the context does not support partial sequence removal
  205. 0.30.071.052 W srv    load_model: speculative decoding will use checkpoints
  206. 0.30.072.002 W common_speculative_init: no implementations specified for speculative decoding
  207. 0.30.072.006 I slot   load_model: id  0 | task -1 | new slot, n_ctx = 131328
  208. 0.30.072.117 I srv    load_model: prompt cache is enabled, size limit: 8192 MiB
  209. 0.30.072.117 I srv    load_model: use `--cache-ram 0` to disable the prompt cache
  210. 0.30.072.119 I srv    load_model: for more info see https://github.com/ggml-org/llama.cpp/pull/16391
  211. 0.30.072.120 I srv    load_model: context checkpoints enabled, max = 32, min spacing = 256
  212. 0.30.072.800 I srv          init: idle slots will be saved to prompt cache upon starting a new task
  213. 0.30.120.780 I init: chat template, example_format: '<|im_start|>system
  214. You are a helpful assistant<|im_end|>
  215. <|im_start|>user
  216. Hello<|im_end|>
  217. <|im_start|>assistant
  218. Hi there<|im_end|>
  219. <|im_start|>user
  220. How are you?<|im_end|>
  221. <|im_start|>assistant
  222. <think>
  223. '
  224. 0.30.142.702 I srv          init: init: chat template, thinking = 1
  225. 0.30.143.682 I srv  llama_server: model loaded
  226. 0.30.143.687 I srv  llama_server: server is listening on http://0.0.0.0:8033
  227. 0.30.143.692 I srv  update_slots: all slots are idle


---------------

n°39241
the_fennec
f3nn3cUs z3rd4
Posté le 13-06-2026 à 13:23:31  profilanswer
 

Tu peux essayer ça pour voir:
 

Code :
  1. -ngl 28 -ts 14,14


---------------
Faudra que je teste un jour :o
n°39248
jojo_le_ha​ricot
Posté le 13-06-2026 à 13:48:07  profilanswer
 

the_fennec a écrit :

Tu peux essayer ça pour voir:

 
Code :
  1. -ngl 28 -ts 14,14


 

Pour le coup ça à l'air de marcher (mais faut pas regarder les perf :o 6tk/s)
Ce que je ne comprends pas c'est que avec --fit-on il a l'air de charger toutes les couches en GPU, ci-dessous les 2 logs.

 

Voici le log avec -ngl 28 -ts 14,14 :

Code :
  1. 0.00.096.377 I common_params_print_info: build 9608 (70b54e140) with Clang 20.1.8 for Windows x86_64
  2. 0.00.096.381 I log_info: verbosity = 4 (adjust with the `-lv N` CLI arg)
  3. 0.00.096.381 I device_info:
  4. 0.00.176.417 I   - CUDA0   : NVIDIA GeForce RTX 3060 (12287 MiB, 11255 MiB free)
  5. 0.00.258.081 I   - CUDA1   : NVIDIA GeForce RTX 3060 (12287 MiB, 11255 MiB free)
  6. 0.00.258.089 I   - CPU     : AMD Ryzen 9 3900X 12-Core Processor             (49070 MiB, 43420 MiB free)
  7. ...
  8. 0.00.496.961 I llama_model_loader: - type  f32:  361 tensors
  9. 0.00.496.961 I llama_model_loader: - type q8_0:  294 tensors
  10. 0.00.496.962 I llama_model_loader: - type q6_K:   78 tensors
  11. 0.00.496.965 I print_info: file format = GGUF V3 (latest)
  12. 0.00.496.966 I print_info: file type   = Q6_K
  13. 0.00.496.970 I print_info: file size   = 29.65 GiB (7.35 BPW)
  14. ...
  15. 0.01.098.465 I load_tensors: loading model tensors, this can take a while... (mmap = false, direct_io = false)
  16. 0.02.822.726 I load_tensors: offloading output layer to GPU
  17. 0.02.822.734 I load_tensors: offloading 27 repeating layers to GPU
  18. 0.02.822.734 I load_tensors: offloaded 28/41 layers to GPU
  19. 0.02.822.757 I load_tensors:        CUDA0 model buffer size = 10224.72 MiB
  20. 0.02.822.759 I load_tensors:        CUDA1 model buffer size = 10001.20 MiB
  21. 0.02.822.764 I load_tensors:    CUDA_Host model buffer size = 10132.19 MiB
  22. ...
 


Voici le log avec --fit on (26tk/s) :

Code :
  1. 0.00.094.545 I common_params_print_info: build 9608 (70b54e140) with Clang 20.1.8 for Windows x86_64
  2. 0.00.094.549 I log_info: verbosity = 4 (adjust with the `-lv N` CLI arg)
  3. 0.00.094.549 I device_info:
  4. 0.00.169.569 I   - CUDA0   : NVIDIA GeForce RTX 3060 (12287 MiB, 11255 MiB free)
  5. 0.00.246.184 I   - CUDA1   : NVIDIA GeForce RTX 3060 (12287 MiB, 11255 MiB free)
  6. 0.00.246.193 I   - CPU     : AMD Ryzen 9 3900X 12-Core Processor             (49070 MiB, 43266 MiB free)
  7. ...
  8. 0.16.266.967 I common_params_fit_impl: memory for test allocation by device:
  9. 0.16.266.974 I common_params_fit_impl: id=0, n_layer=14, n_part= 1, overflow_type=1, mem= 10569 MiB
  10. 0.16.266.975 I common_params_fit_impl: id=1, n_layer=27, n_part=17, overflow_type=1, mem= 10544 MiB
  11. 0.16.266.978 I common_params_fit_impl: set ngl_per_device[1].(n_layer, n_part, overflow_type)=(27, 17, ATTN), id_dense_start=1
  12. 0.16.266.982 I common_params_fit_impl:   - CUDA1 (NVIDIA GeForce RTX 3060): 27 layers (17 overflowing),  10544 MiB used,    680 MiB free
  13. 0.16.266.986 I common_fit_params: successfully fit params to free device memory
  14. ...
  15. 0.16.963.956 I load_tensors: loading model tensors, this can take a while... (mmap = false, direct_io = false)
  16. 0.18.941.957 I load_tensors: offloading output layer to GPU
  17. 0.18.941.965 I load_tensors: offloading 39 repeating layers to GPU
  18. 0.18.941.966 I load_tensors: offloaded 41/41 layers to GPU
  19. 0.18.941.988 I load_tensors:        CUDA0 model buffer size =  9651.52 MiB
  20. 0.18.941.991 I load_tensors:        CUDA1 model buffer size =  9114.08 MiB
  21. 0.18.941.995 I load_tensors:    CUDA_Host model buffer size = 11592.51 MiB
  22. ...
 

Message cité 1 fois
Message édité par jojo_le_haricot le 13-06-2026 à 14:38:29

---------------

n°39252
extenue1
Posté le 13-06-2026 à 14:16:40  profilanswer
 

T'es un bon toi , tu devrais faire plus long next time

n°39309
the_fennec
f3nn3cUs z3rd4
Posté le 13-06-2026 à 18:42:05  profilanswer
 

jojo_le_haricot a écrit :


 
Pour le coup ça à l'air de marcher (mais faut pas regarder les perf :o 6tk/s)
Ce que je ne comprends pas c'est que avec --fit-on il a l'air de charger toutes les couches en GPU, ci-dessous les 2 logs.
 
Voici le log avec -ngl 28 -ts 14,14 :

Code :
  1. 0.00.096.377 I common_params_print_info: build 9608 (70b54e140) with Clang 20.1.8 for Windows x86_64
  2. 0.00.096.381 I log_info: verbosity = 4 (adjust with the `-lv N` CLI arg)
  3. 0.00.096.381 I device_info:
  4. 0.00.176.417 I   - CUDA0   : NVIDIA GeForce RTX 3060 (12287 MiB, 11255 MiB free)
  5. 0.00.258.081 I   - CUDA1   : NVIDIA GeForce RTX 3060 (12287 MiB, 11255 MiB free)
  6. 0.00.258.089 I   - CPU     : AMD Ryzen 9 3900X 12-Core Processor             (49070 MiB, 43420 MiB free)
  7. ...
  8. 0.00.496.961 I llama_model_loader: - type  f32:  361 tensors
  9. 0.00.496.961 I llama_model_loader: - type q8_0:  294 tensors
  10. 0.00.496.962 I llama_model_loader: - type q6_K:   78 tensors
  11. 0.00.496.965 I print_info: file format = GGUF V3 (latest)
  12. 0.00.496.966 I print_info: file type   = Q6_K
  13. 0.00.496.970 I print_info: file size   = 29.65 GiB (7.35 BPW)
  14. ...
  15. 0.01.098.465 I load_tensors: loading model tensors, this can take a while... (mmap = false, direct_io = false)
  16. 0.02.822.726 I load_tensors: offloading output layer to GPU
  17. 0.02.822.734 I load_tensors: offloading 27 repeating layers to GPU
  18. 0.02.822.734 I load_tensors: offloaded 28/41 layers to GPU
  19. 0.02.822.757 I load_tensors:        CUDA0 model buffer size = 10224.72 MiB
  20. 0.02.822.759 I load_tensors:        CUDA1 model buffer size = 10001.20 MiB
  21. 0.02.822.764 I load_tensors:    CUDA_Host model buffer size = 10132.19 MiB
  22. ...


 
 
Voici le log avec --fit on (26tk/s) :

Code :
  1. 0.00.094.545 I common_params_print_info: build 9608 (70b54e140) with Clang 20.1.8 for Windows x86_64
  2. 0.00.094.549 I log_info: verbosity = 4 (adjust with the `-lv N` CLI arg)
  3. 0.00.094.549 I device_info:
  4. 0.00.169.569 I   - CUDA0   : NVIDIA GeForce RTX 3060 (12287 MiB, 11255 MiB free)
  5. 0.00.246.184 I   - CUDA1   : NVIDIA GeForce RTX 3060 (12287 MiB, 11255 MiB free)
  6. 0.00.246.193 I   - CPU     : AMD Ryzen 9 3900X 12-Core Processor             (49070 MiB, 43266 MiB free)
  7. ...
  8. 0.16.266.967 I common_params_fit_impl: memory for test allocation by device:
  9. 0.16.266.974 I common_params_fit_impl: id=0, n_layer=14, n_part= 1, overflow_type=1, mem= 10569 MiB
  10. 0.16.266.975 I common_params_fit_impl: id=1, n_layer=27, n_part=17, overflow_type=1, mem= 10544 MiB
  11. 0.16.266.978 I common_params_fit_impl: set ngl_per_device[1].(n_layer, n_part, overflow_type)=(27, 17, ATTN), id_dense_start=1
  12. 0.16.266.982 I common_params_fit_impl:   - CUDA1 (NVIDIA GeForce RTX 3060): 27 layers (17 overflowing),  10544 MiB used,    680 MiB free
  13. 0.16.266.986 I common_fit_params: successfully fit params to free device memory
  14. ...
  15. 0.16.963.956 I load_tensors: loading model tensors, this can take a while... (mmap = false, direct_io = false)
  16. 0.18.941.957 I load_tensors: offloading output layer to GPU
  17. 0.18.941.965 I load_tensors: offloading 39 repeating layers to GPU
  18. 0.18.941.966 I load_tensors: offloaded 41/41 layers to GPU
  19. 0.18.941.988 I load_tensors:        CUDA0 model buffer size =  9651.52 MiB
  20. 0.18.941.991 I load_tensors:        CUDA1 model buffer size =  9114.08 MiB
  21. 0.18.941.995 I load_tensors:    CUDA_Host model buffer size = 11592.51 MiB
  22. ...


 


 
 
J'avais oublié le -ngl qui dit combien de layers mettre en GPU vs CPU, -ts dis juste la répartition.
 
Tu pourrais tester ça pour être sur que les layers MoE vont sur le CPU:
 

Code :
  1. -ngl 30 -ts 15,15 --n-cpu-moe 11


 
Après ça pourrait être intéressant d'essayer des quants plus petits pour que tout reste en VRAM. Mais c'est déjà pas mal que ça charge bien maintenant.


---------------
Faudra que je teste un jour :o
n°39310
the_fennec
f3nn3cUs z3rd4
Posté le 13-06-2026 à 18:43:50  profilanswer
 

extenue1 a écrit :

T'es un bon toi , tu devrais faire plus long next time


 
C'est très pratique pour moi d'avoir les logs, je vois pas en quoi ça gène.


---------------
Faudra que je teste un jour :o
n°39311
neo world
Posté le 13-06-2026 à 20:13:00  profilanswer
 

effectivement mettre un drapal sur un topic de bricoleurs en IA local puis s'étonner de voir des tartines de logs  :whistle:

n°39314
jojo_le_ha​ricot
Posté le 13-06-2026 à 20:34:03  profilanswer
 

extenue1 a écrit :

T'es un bon toi , tu devrais faire plus long next time

  :kaola:  
 

the_fennec a écrit :

C'est très pratique pour moi d'avoir les logs, je vois pas en quoi ça gène.

[:charlest]
 

neo world a écrit :

effectivement mettre un drapal sur un topic de bricoleurs en IA local puis s'étonner de voir des tartines de logs  :whistle:

[:charlest]
 
 
 

the_fennec a écrit :


 
J'avais oublié le -ngl qui dit combien de layers mettre en GPU vs CPU, -ts dis juste la répartition.
 
Tu pourrais tester ça pour être sur que les layers MoE vont sur le CPU:
 

Code :
  1. -ngl 30 -ts 15,15 --n-cpu-moe 11


 
Après ça pourrait être intéressant d'essayer des quants plus petits pour que tout reste en VRAM. Mais c'est déjà pas mal que ça charge bien maintenant.


 
Alors j'ai bien réussi à charger le modèle avec

Code :
  1. -ngl 28 -ts 14,14 --n-cpu-moe 13

mais avec des perf pas ouf (8tk/s)
 
Du coup je vais rester avec --fit on sans utiliser --n-cpu-moe et garder des perf convenables. Merci pour le coup de main  ;)  
 


---------------

n°39324
the_fennec
f3nn3cUs z3rd4
Posté le 14-06-2026 à 09:45:38  profilanswer
 

jojo_le_haricot a écrit :

Alors j'ai bien réussi à charger le modèle avec

Code :
  1. -ngl 28 -ts 14,14 --n-cpu-moe 13

mais avec des perf pas ouf (8tk/s)
 
Du coup je vais rester avec --fit on sans utiliser --n-cpu-moe et garder des perf convenables. Merci pour le coup de main  ;)  


 
De rien :jap: même si j'aurais bien voulu comprendre le problème  :lol: .


---------------
Faudra que je teste un jour :o
n°39333
Pipould's
Posté le 14-06-2026 à 12:15:26  profilanswer
 

Cpu Moe si tu veux pas trop d'impact il faut vraiment de la ddr5 rapide...

n°39343
TotalRecal​l
Posté le 14-06-2026 à 16:46:06  profilanswer
 

Plop,
Des gens qui utilisent LM Studio avec une RX9070XT (ou autre AMD) ici ?
Je suis passé des Adrenalin 2026.3.1 aux 2026.6.1 et ça m'a pourri le support ROCm / HIP.
A priori pourtant c'est livré avec du ROCm 7 sans changement majeur mais ça marche plus quand même :o (0 GPU détecté).
J'avais lu que les 2026.5 posaient pas mal de soucis...
Donc sauf si quelqu'un a une astuce, autant rester en 2026.3.1 pour ceux qui peuvent...


Message édité par TotalRecall le 14-06-2026 à 16:47:09

---------------
Topic .Net - C# @ Prog
n°39353
the_fennec
f3nn3cUs z3rd4
Posté le 14-06-2026 à 18:20:02  profilanswer
 

Tu peux pas passer en Vulkan? ROCm ça sent un peu la fesse :o
J'ai des meilleurs perfs en Vulkan que CUDA sur ma 4060Ti.


Message édité par the_fennec le 14-06-2026 à 18:20:42

---------------
Faudra que je teste un jour :o
n°39354
TotalRecal​l
Posté le 14-06-2026 à 18:41:44  profilanswer
 

J'aurais bien tenté, mais il me dit "0 GPU" et l'installation des back-end semble se faire, puis le bouton download revient comme si j'avais rien fait.  
J'ai tenté de renommer mon dossier .lmstudio au cas où il aurait gardé une connerie en cache pour lui faire régénérer la conf de base, mais exactement pareil.
Comme j'ai exactement le même pb avec Blender ça sent quand même la régression côté HIP, d'autant que les 2026.5 avaient apparemment ce souci.


---------------
Topic .Net - C# @ Prog
n°39355
neo world
Posté le 14-06-2026 à 19:09:07  profilanswer
 

Tu peux réinstaller / rollback Adrenalin pour voir si le problème c’est bien la nouvelle Maj ?
 
Si besoin y’a des outils de config / vérification via amd-smi. Mais ils semblent disponibles que via Linux. Peut être que tu pourrais te faire une VM de gestion de l’IA avec Linux et tes outils préférés en mode GPU pass through via ton outil de virtualisation ?
 
Au moins tu touches pas trop aux paramètres, tu peux faire des snapshots tout en laissant vivre ta machine windows ?

n°39358
TotalRecal​l
Posté le 14-06-2026 à 19:28:51  profilanswer
 

J'ai rien changé d'autre que cette MAJ donc j'ai pas trop de doute :o.  
Si d'ici 15j y a pas un patch côté AMD ou côté LM Studio, je ferai effectivement le retour à la 2026.3.1, mais je voulais au moins partager l'info.
 
J'y ai pensé mais j'ai pas pris le temps pour ça, et j'imagine qu'il y aura évidemment un coût en perfs lié à la virtu. J'hésite aussi à tout simplement acheter une machine dédiée si je commence vraiment à capitaliser sur du local (ce qui n'est pas encore le cas pour mes besoins essentiels).


---------------
Topic .Net - C# @ Prog
n°39360
the_fennec
f3nn3cUs z3rd4
Posté le 14-06-2026 à 19:42:51  profilanswer
 

Essaye llama.cpp :o


---------------
Faudra que je teste un jour :o
n°39361
the_fennec
f3nn3cUs z3rd4
Posté le 14-06-2026 à 19:44:31  profilanswer
 

Qwen 3.6 35B-A3B — Cerebellum GGUF
https://huggingface.co/deucebucket/ [...] ellum-GGUF
 

Citation :

v3 at 11 GB is 29% smaller than stock Q3_K_M (15.6 GB) while outperforming it on 4 of the 5 measured benchmarks (ARC is the one it loses; the vision check has no Q3_K_M baseline to compare). The Q2_K regularization effect on gate/mixing weights actively improves downstream task performance despite reducing perplexity.


 
Pas testé, mais pourrait intéresser ceux avec 16GB de VRAM.


---------------
Faudra que je teste un jour :o
n°39362
TotalRecal​l
Posté le 14-06-2026 à 19:45:59  profilanswer
 

Bof, entre Ollama, LM Studio et Lemonade j'ai déjà essayé assez de trucs comme ça :o
Lemonade fonctionne toujours mais il est bcp moins sympa en termes de paramétrage que LM Studio...


Message édité par TotalRecall le 14-06-2026 à 19:49:13

---------------
Topic .Net - C# @ Prog
n°39363
the_fennec
f3nn3cUs z3rd4
Posté le 14-06-2026 à 20:08:15  profilanswer
 

Je connais pas trop LM Studio, je sais pas comment lui faire utiliser Vulkan qui pourrait régler ton PB de drivers. Avec llama.cpp c'est juste un zip a DL.


---------------
Faudra que je teste un jour :o
n°39372
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 15-06-2026 à 07:03:25  profilanswer
 

llama.cpp y a rien de mieux clairement  :love:


---------------
Victime de girafophobie, mais se soigne.
n°39374
the_fennec
f3nn3cUs z3rd4
Posté le 15-06-2026 à 08:28:53  profilanswer
 

Surtout que les LMStudio/Ollama/etc sont juste des UI par dessus...


---------------
Faudra que je teste un jour :o
n°39387
Plam
Bear Metal
Posté le 15-06-2026 à 10:01:36  profilanswer
 

Tronklou a écrit :

llama.cpp y a rien de mieux clairement  :love:


 
Si si, en multi user c'est vLLM qui va bien :)


---------------
Spécialiste du bear metal
n°39394
the_fennec
f3nn3cUs z3rd4
Posté le 15-06-2026 à 10:45:56  profilanswer
 

Plam a écrit :


 
Si si, en multi user c'est vLLM qui va bien :)


 
vLLM est pas vraiment fait pour du local, c'est pour la prod.


---------------
Faudra que je teste un jour :o
n°39399
Pipould's
Posté le 15-06-2026 à 11:04:50  profilanswer
 

the_fennec a écrit :

 

vLLM est pas vraiment fait pour du local, c'est pour la prod.


En quoi la prod ne pourrait pas être locale?

n°39401
the_fennec
f3nn3cUs z3rd4
Posté le 15-06-2026 à 11:13:37  profilanswer
 

Pipould's a écrit :


En quoi la prod ne pourrait pas être locale?


 
Pas faux :)
C'est juste que j'ai pas trop vu de retours ici sur de la prod.


---------------
Faudra que je teste un jour :o
n°39403
Pipould's
Posté le 15-06-2026 à 12:57:50  profilanswer
 

the_fennec a écrit :

 

Pas faux :)
C'est juste que j'ai pas trop vu de retours ici sur de la prod.

 

Vllm la différence c'est que c'est un peu plus pénible pour charger / décharger les modèles, ça appelle a une config stable. Du coup en setup local ou pme llama.cpp semble mieux.

n°39404
croustx
Modoadorateur
Posté le 15-06-2026 à 12:58:33  profilanswer
 

the_fennec a écrit :


 
Pareil que neo world, j'utilise pas ollama, llama.cpp c'est mieux.
 
T'as des logs?
Généralement quand un LLM réponds pas c'est qu'on lui passe pas le bon non de modèle, c'est pour ça que j'utilise un "-alias default" comme ça mon modèle s'appelle "default" quelque soit celui que je charge. Mais j'imagine que ollama doit le faire tout seul.
 
Essaye avec llama.cpp et une install de Openclaw peut être.


 
En utilisant le modèle Heretic, il répond n'importe quoi via openclaw et Ollama.
 
Genre :
- bon, ça va ?
- "B"
 
En direct dans Ollama ça marche bien.
 
Le modèle non-heretic fonctionne bien

n°39406
the_fennec
f3nn3cUs z3rd4
Posté le 15-06-2026 à 14:33:01  profilanswer
 

croustx a écrit :


 
En utilisant le modèle Heretic, il répond n'importe quoi via openclaw et Ollama.
 
Genre :
- bon, ça va ?
- "B"
 
En direct dans Ollama ça marche bien.
 
Le modèle non-heretic fonctionne bien


 
Ça ressemble a mauvais budget genre 1 passé.
Ollama ajoute tellement de truc que c'est difficile de savoir, c'est pour ça que je l'utilise pas.


---------------
Faudra que je teste un jour :o
n°39450
Plam
Bear Metal
Posté le 16-06-2026 à 09:54:12  profilanswer
 

the_fennec a écrit :


 
Pas faux :)
C'est juste que j'ai pas trop vu de retours ici sur de la prod.


 
Bah ici c'est de la prod, avec Qwen et vLLM :)


---------------
Spécialiste du bear metal
n°39461
the_fennec
f3nn3cUs z3rd4
Posté le 16-06-2026 à 10:27:23  profilanswer
 

Plam a écrit :


 
Bah ici c'est de la prod, avec Qwen et vLLM :)


 
J'ai retrouvé tes posts  :jap:  
 [:pachyderme]


---------------
Faudra que je teste un jour :o
n°39490
toutsec
Posté le 16-06-2026 à 14:39:41  profilanswer
 

Bonjour,
J'ai un compte claude code max. J'aimerais l'utiliser sur des choses de travail sensible : pour commencer, faire des résumés de meetings en donnant le transcript.  
Est ce que je peux passer par ollama pour garder ce genre de données en local?
 
Sinon, quelle serait la bonne façon de procéder?

n°39494
croustx
Modoadorateur
Posté le 16-06-2026 à 15:06:49  profilanswer
 

the_fennec a écrit :


 
Ça ressemble a mauvais budget genre 1 passé.
Ollama ajoute tellement de truc que c'est difficile de savoir, c'est pour ça que je l'utilise pas.


 
Donc ton conseil c'est d'utiliser Llama.cpp ?

 Page :   1  2  3  4  5  ..  15  16  17  ..  67  68  69  70  71  72

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)