Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
3254 connectés 

 


Quel titre pour notre topic ?
Sondage à 8 choix possibles.
Ce sondage expirera le 15-08-2026 à 10:00




Attention si vous cliquez sur "voir les résultats" vous ne pourrez plus voter

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  27  28  29  30  31  32
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°43810
neo world
Posté le 31-07-2026 à 22:25:24  profilanswer
 

Reprise du message précédent :
j'ai de quoi faire tourner la version 3bit mais je remonte mon infra seulement courant de semaine prochaine :jap:

n°43811
neo world
Posté le 31-07-2026 à 22:25:54  profilanswer
 

M300A a écrit :

Ptetre lundi si les gars de bougent


Juste au moment de partir en vacances ? :o

n°43823
Plam
Bear Metal
Posté le 01-08-2026 à 07:57:45  profilanswer
 

Olivie a écrit :

Qui a le matos pour tester ? :o

 
Citation :

@UnslothAI

 

DeepSeek V4 Flash 0731 can now be run locally!

 

Run DeepSeek V4 Flash lossless 4-bit on 168GB RAM and 3-bit on 110GB RAM.

 

V4 Flash 0731 outperforms V4 Pro. Run via Unsloth or llama.cpp. Smaller quants coming today.

 

Guide: https://unsloth.ai/docs/models/deepseek-v4
GGUF: https://huggingface.co/unsloth/Deep [...] -0731-GGUF


 

2x spark et c'est ok-ish.


---------------
Spécialiste du bear metal
n°43834
Jules Winn​field
порой не та...
Posté le 01-08-2026 à 09:13:04  profilanswer
 

BC250 à 140€ sur ali pour les intéressés  
https://www.dealabs.com/bons-plans/bc-250-amd-3385477

n°43841
the_fennec
f3nn3cUs z3rd4
Posté le 01-08-2026 à 10:34:43  profilanswer
 

C'est bon je suis équipé :o
140 ça commence à être chère.


---------------
Faudra que je teste un jour :o
n°43842
neo world
Posté le 01-08-2026 à 10:41:24  profilanswer
 

c'est même pas le prix de la gddr qui l'équipe ^^

n°43844
extenue1
Posté le 01-08-2026 à 11:25:16  profilanswer
 

Un peu HS mais qqun aurait un article ou video montrant quoi acheter d'autre pour se monter un PC entier autour de cette carte ?

n°43845
neo world
Posté le 01-08-2026 à 11:38:15  profilanswer
 

Ajoute ça à tes signets : https://github.com/akandr/bc250
 
Ça aborde aussi la partie unlock des unités des calcul :D

n°43846
the_fennec
f3nn3cUs z3rd4
Posté le 01-08-2026 à 11:52:48  profilanswer
 

extenue1 a écrit :

Un peu HS mais qqun aurait un article ou video montrant quoi acheter d'autre pour se monter un PC entier autour de cette carte ?


 
Il manque juste un SSD nvme/sata et un ventilo c'est tout.


---------------
Faudra que je teste un jour :o
n°43847
the_fennec
f3nn3cUs z3rd4
Posté le 01-08-2026 à 11:54:17  profilanswer
 

D'ailleurs un unlock des 2 cores CPU manquant est sortis, mais j'ai pas testé:
https://github.com/rw-r-r-0644/bc250-core-unlock


---------------
Faudra que je teste un jour :o
n°43848
AllenMadis​on
Oracle du Keb's
Posté le 01-08-2026 à 11:55:59  profilanswer
 

neo world a écrit :

Ajoute ça à tes signets : https://github.com/akandr/bc250
 
Ça aborde aussi la partie unlock des unités des calcul :D


 
Rien que de lire toute sa page je suis épuisé :o
 
Sacré boulot.


---------------
Nothing much to teach, man. There's ze high, there's ze low and yall still fucking miss.
n°43849
neo world
Posté le 01-08-2026 à 12:10:02  profilanswer
 

T’avais aussi une vidéo pour la partie optimisation / overclocking / case qui est dans le descriptif de dealabs :
https://m.youtube.com/watch?v=LTxC_igsVms

n°43868
neo world
Posté le 01-08-2026 à 16:17:39  profilanswer
 

Si vous avez au moins 2To de NVME :
 
Kimi K3 sur MAC OS (X86 et M silicon) :
https://github.com/gavamedia/deltafin
 
3.76 s/token exact-oracle median in the reference completion on our M1 Max after int8 conversion  [:bouh94:1]  
 
Vous avez même une version qui tient dans 215GB en disque ...  
~3+ min/token for anything not already cached   [:yoskeletone]  
 
Ou via Colibri pour tous les autres   [:sebxoii]  
https://github.com/JustVugg/colibri
 
avec les benchmarks https://github.com/JustVugg/colibri [...] s-measured
 
On arrive assez fréquemment aux environs des 1.8 tokens / seconde sustained (par exemple avec le strix halo. le cold start est un pwal lent à 0.06 tok/seconde par contre [:hello_cass] )


Message édité par neo world le 01-08-2026 à 17:50:45
n°43884
the_fennec
f3nn3cUs z3rd4
Posté le 01-08-2026 à 18:11:39  profilanswer
 

Combien en PP?


---------------
Faudra que je teste un jour :o
n°43906
M300A
Posté le 01-08-2026 à 21:54:32  profilanswer
 

Citation :


(APIServer pid=7) INFO 08-01 19:50:36 [loggers.py:314] Engine 000: Avg prompt throughput: 2106.5 tokens/s, Avg generation throughput: 159.8 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 76.4%
(APIServer pid=7) INFO 08-01 19:50:46 [loggers.py:314] Engine 000: Avg prompt throughput: 6763.6 tokens/s, Avg generation throughput: 98.9 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.8%, Prefix cache hit rate: 76.2%
(APIServer pid=7) INFO 08-01 19:50:56 [loggers.py:314] Engine 000: Avg prompt throughput: 3944.0 tokens/s, Avg generation throughput: 106.4 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 1.1%, Prefix cache hit rate: 79.6%
(APIServer pid=7) INFO 08-01 19:51:06 [loggers.py:314] Engine 000: Avg prompt throughput: 222.3 tokens/s, Avg generation throughput: 86.3 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 81.8%
(APIServer pid=7) INFO 08-01 19:51:16 [loggers.py:314] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 0.0 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 81.8%
(APIServer pid=7) INFO 08-01 19:51:26 [loggers.py:314] Engine 000: Avg prompt throughput: 149.8 tokens/s, Avg generation throughput: 28.7 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 82.7%
(APIServer pid=7) INFO 08-01 19:51:36 [loggers.py:314] Engine 000: Avg prompt throughput: 2949.9 tokens/s, Avg generation throughput: 205.3 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 14.3%, Prefix cache hit rate: 82.4%
(APIServer pid=7) INFO 08-01 19:51:46 [loggers.py:314] Engine 000: Avg prompt throughput: 4821.4 tokens/s, Avg generation throughput: 143.2 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.7%, Prefix cache hit rate: 82.7%
(APIServer pid=7) INFO 08-01 19:51:56 [loggers.py:314] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 244.3 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.7%, Prefix cache hit rate: 82.7%
(APIServer pid=7) INFO 08-01 19:52:06 [loggers.py:314] Engine 000: Avg prompt throughput: 431.7 tokens/s, Avg generation throughput: 214.0 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.7%, Prefix cache hit rate: 83.5%
(APIServer pid=7) INFO 08-01 19:52:16 [loggers.py:314] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 245.4 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.8%, Prefix cache hit rate: 83.5%
(APIServer pid=7) INFO 08-01 19:52:26 [loggers.py:314] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 256.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.8%, Prefix cache hit rate: 83.5%
(APIServer pid=7) INFO 08-01 19:52:36 [loggers.py:314] Engine 000: Avg prompt throughput: 713.5 tokens/s, Avg generation throughput: 180.4 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 1.2%, Prefix cache hit rate: 84.0%
(APIServer pid=7) INFO 08-01 19:52:46 [loggers.py:314] Engine 000: Avg prompt throughput: 1060.3 tokens/s, Avg generation throughput: 188.3 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 1.4%, Prefix cache hit rate: 84.4%
(APIServer pid=7) INFO 08-01 19:52:56 [loggers.py:314] Engine 000: Avg prompt throughput: 317.4 tokens/s, Avg generation throughput: 205.3 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 1.4%, Prefix cache hit rate: 85.6%
(APIServer pid=7) INFO 08-01 19:53:06 [loggers.py:314] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 246.5 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 1.4%, Prefix cache hit rate: 85.6%
(APIServer pid=7) INFO 08-01 19:53:16 [loggers.py:314] Engine 000: Avg prompt throughput: 135.6 tokens/s, Avg generation throughput: 99.9 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 86.7%
(APIServer pid=7) INFO 08-01 19:53:26 [loggers.py:314] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 0.0 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 86.7%


 
C'est bien ?


---------------
:wq
n°43907
neo world
Posté le 01-08-2026 à 22:03:35  profilanswer
 

the_fennec a écrit :

Combien en PP?


 
j'ai vu aucune info sur une phase de pp plus rapide que le decode (le NPU ne doit servir à rien ici et les questions posées pour les benchs font genre 30 / 60 tokens  [:sid sidious:1] ). Ca evolue quand même assez vite (X2 en vitesse entre les premiers benchs et les dernières releases de colibri sur AMD AI Strix Halo) mais le Mac est largement avantagé grâce à la paire NVME et RAM plus rapide.
 
j'imagine que tu dois rattraper un peu la perf si tu passes en NVME PCI 5.0 mais je n'aurai pas ce plaisir comme je suis limité au PCI express 4.0. Y'a p't'être un truc à jouer en RAID0 mais je pense qu'une approche plus raisonnable (retravailler à partir de l'unsloth Dynamic 2-bit XXS ou UD-Q2_K_XL qui divise par plus de deux la taille du modèle) est plus viable.
 
Pour bosser au quotidien ça reste inutilisable. Vaut mieux partir sur le V4 flash avec des perfs beaucoup pratiques pour le quotidien :jap: :
https://www.reddit.com/r/LocalLLaMA [...] _ryzen_ai/

Message cité 1 fois
Message édité par neo world le 01-08-2026 à 22:04:05
n°43908
neo world
Posté le 01-08-2026 à 22:05:12  profilanswer
 

M300A a écrit :

Citation :


(APIServer pid=7) INFO 08-01 19:50:36 [loggers.py:314] Engine 000: Avg prompt throughput: 2106.5 tokens/s, Avg generation throughput: 159.8 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 76.4%
(APIServer pid=7) INFO 08-01 19:50:46 [loggers.py:314] Engine 000: Avg prompt throughput: 6763.6 tokens/s, Avg generation throughput: 98.9 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.8%, Prefix cache hit rate: 76.2%
(APIServer pid=7) INFO 08-01 19:50:56 [loggers.py:314] Engine 000: Avg prompt throughput: 3944.0 tokens/s, Avg generation throughput: 106.4 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 1.1%, Prefix cache hit rate: 79.6%
(APIServer pid=7) INFO 08-01 19:51:06 [loggers.py:314] Engine 000: Avg prompt throughput: 222.3 tokens/s, Avg generation throughput: 86.3 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 81.8%
(APIServer pid=7) INFO 08-01 19:51:16 [loggers.py:314] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 0.0 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 81.8%
(APIServer pid=7) INFO 08-01 19:51:26 [loggers.py:314] Engine 000: Avg prompt throughput: 149.8 tokens/s, Avg generation throughput: 28.7 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 82.7%
(APIServer pid=7) INFO 08-01 19:51:36 [loggers.py:314] Engine 000: Avg prompt throughput: 2949.9 tokens/s, Avg generation throughput: 205.3 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 14.3%, Prefix cache hit rate: 82.4%
(APIServer pid=7) INFO 08-01 19:51:46 [loggers.py:314] Engine 000: Avg prompt throughput: 4821.4 tokens/s, Avg generation throughput: 143.2 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.7%, Prefix cache hit rate: 82.7%
(APIServer pid=7) INFO 08-01 19:51:56 [loggers.py:314] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 244.3 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.7%, Prefix cache hit rate: 82.7%
(APIServer pid=7) INFO 08-01 19:52:06 [loggers.py:314] Engine 000: Avg prompt throughput: 431.7 tokens/s, Avg generation throughput: 214.0 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.7%, Prefix cache hit rate: 83.5%
(APIServer pid=7) INFO 08-01 19:52:16 [loggers.py:314] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 245.4 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.8%, Prefix cache hit rate: 83.5%
(APIServer pid=7) INFO 08-01 19:52:26 [loggers.py:314] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 256.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.8%, Prefix cache hit rate: 83.5%
(APIServer pid=7) INFO 08-01 19:52:36 [loggers.py:314] Engine 000: Avg prompt throughput: 713.5 tokens/s, Avg generation throughput: 180.4 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 1.2%, Prefix cache hit rate: 84.0%
(APIServer pid=7) INFO 08-01 19:52:46 [loggers.py:314] Engine 000: Avg prompt throughput: 1060.3 tokens/s, Avg generation throughput: 188.3 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 1.4%, Prefix cache hit rate: 84.4%
(APIServer pid=7) INFO 08-01 19:52:56 [loggers.py:314] Engine 000: Avg prompt throughput: 317.4 tokens/s, Avg generation throughput: 205.3 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 1.4%, Prefix cache hit rate: 85.6%
(APIServer pid=7) INFO 08-01 19:53:06 [loggers.py:314] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 246.5 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 1.4%, Prefix cache hit rate: 85.6%
(APIServer pid=7) INFO 08-01 19:53:16 [loggers.py:314] Engine 000: Avg prompt throughput: 135.6 tokens/s, Avg generation throughput: 99.9 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 86.7%
(APIServer pid=7) INFO 08-01 19:53:26 [loggers.py:314] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 0.0 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 86.7%


 
C'est bien ?


ton monstre a été installé vendredi finalement ? :D
 
C'est quel modèle qui tourne ?

n°43909
M300A
Posté le 01-08-2026 à 22:10:41  profilanswer
 

neo world a écrit :


ton monstre a été installé vendredi finalement ? :D
 
C'est quel modèle qui tourne ?


 
Les gars ont branchés et coup de bol, ils avaient mis la carte de management, les deux fibres et les SFP.
Rien d'installer ni de config, mais j'ai fait ca cette aprem, avec un Proxmox par dessus.
 
DS4 Flash 0731
 
 


Sat Aug  1 20:12:51 2026        
+-----------------------------------------------------------------------------------------+
| NVIDIA-SMI 610.43.02              KMD Version: 610.43.02     CUDA UMD Version: 13.3     |
+-----------------------------------------+------------------------+----------------------+
| GPU  Name                 Persistence-M | Bus-Id          Disp.A | Volatile Uncorr. ECC |
| Fan  Temp   Perf          Pwr:Usage/Cap |           Memory-Usage | GPU-Util  Compute M. |
|                                         |                        |               MIG M. |
|=========================================+========================+======================|
|   0  NVIDIA RTX PRO 6000 Blac...    On  |   00000000:01:00.0 Off |                    0 |
| N/A   30C    P0             90W /  600W |   97165MiB /  97887MiB |      0%      Default |
|                                         |                        |             Disabled |
+-----------------------------------------+------------------------+----------------------+
|   1  NVIDIA RTX PRO 6000 Blac...    On  |   00000000:02:00.0 Off |                    0 |
| N/A   29C    P0             87W /  600W |   97163MiB /  97887MiB |      0%      Default |
|                                         |                        |             Disabled |
+-----------------------------------------+------------------------+----------------------+
|   2  NVIDIA RTX PRO 6000 Blac...    On  |   00000000:03:00.0 Off |                    0 |
| N/A   30C    P0             87W /  600W |   97165MiB /  97887MiB |      0%      Default |
|                                         |                        |             Disabled |
+-----------------------------------------+------------------------+----------------------+
|   3  NVIDIA RTX PRO 6000 Blac...    On  |   00000000:04:00.0 Off |                    0 |
| N/A   30C    P0             88W /  600W |   97161MiB /  97887MiB |      0%      Default |
|                                         |                        |             Disabled |
+-----------------------------------------+------------------------+----------------------+
 
+-----------------------------------------------------------------------------------------+
| Processes:                                                                              |
|  GPU   GI   CI              PID   Type   Process name                        GPU Memory |
|        ID   ID                                                               Usage      |
|=========================================================================================|
|    0   N/A  N/A            5183      C   VLLM::Worker_TP0                      97156MiB |
|    1   N/A  N/A            5184      C   VLLM::Worker_TP1                      97154MiB |
|    2   N/A  N/A            5185      C   VLLM::Worker_TP2                      97156MiB |
|    3   N/A  N/A            5186      C   VLLM::Worker_TP3                      97152MiB |
+-----------------------------------------------------------------------------------------+


Message édité par M300A le 01-08-2026 à 22:13:11

---------------
:wq
n°43910
neo world
Posté le 01-08-2026 à 22:15:05  profilanswer
 

ça me parait léger (enfin façon de parler vu la bestiole :o )
 
Tu utilises quelle ligne de commande ? nvidia-smi dit quoi pendant l'inférence ?

n°43911
M300A
Posté le 01-08-2026 à 22:22:47  profilanswer
 

neo world a écrit :

ça me parait léger (enfin façon de parler vu la bestiole :o )

 

Tu utilises quelle ligne de commande ? nvidia-smi dit quoi pendant l'inférence ?

 

Par exemple:

 


root@llm:~/blackwell-llm-docker# nvidia-smi
Sat Aug  1 20:22:22 2026      
+-----------------------------------------------------------------------------------------+
| NVIDIA-SMI 610.43.02              KMD Version: 610.43.02     CUDA UMD Version: 13.3     |
+-----------------------------------------+------------------------+----------------------+
| GPU  Name                 Persistence-M | Bus-Id          Disp.A | Volatile Uncorr. ECC |
| Fan  Temp   Perf          Pwr:Usage/Cap |           Memory-Usage | GPU-Util  Compute M. |
|                                         |                        |               MIG M. |
|=========================================+========================+======================|
|   0  NVIDIA RTX PRO 6000 Blac...    On  |   00000000:01:00.0 Off |                    0 |
| N/A   37C    P0            255W /  600W |   97165MiB /  97887MiB |    100%      Default |
|                                         |                        |             Disabled |
+-----------------------------------------+------------------------+----------------------+
|   1  NVIDIA RTX PRO 6000 Blac...    On  |   00000000:02:00.0 Off |                    0 |
| N/A   36C    P0            258W /  600W |   97163MiB /  97887MiB |    100%      Default |
|                                         |                        |             Disabled |
+-----------------------------------------+------------------------+----------------------+
|   2  NVIDIA RTX PRO 6000 Blac...    On  |   00000000:03:00.0 Off |                    0 |
| N/A   36C    P0            258W /  600W |   97165MiB /  97887MiB |    100%      Default |
|                                         |                        |             Disabled |
+-----------------------------------------+------------------------+----------------------+
|   3  NVIDIA RTX PRO 6000 Blac...    On  |   00000000:04:00.0 Off |                    0 |
| N/A   37C    P0            271W /  600W |   97161MiB /  97887MiB |    100%      Default |
|                                         |                        |             Disabled |
+-----------------------------------------+------------------------+----------------------+

 


La commande:

 

/opt/venv/bin/python /opt/venv/bin/vllm serve \
  deepseek-ai/DeepSeek-V4-Flash-0731 \
  --revision 9e165c30e2704aec5d9d593cce3eebd58bbef1cb \
  --served-model-name DeepSeek-V4-Flash-0731 \
  --host 0.0.0.0 \
  --port 8000 \
  --trust-remote-code \
  --kv-cache-dtype fp8 \
  --block-size 256 \
  --load-format instanttensor \
  --tensor-parallel-size 4 \
  --decode-context-parallel-size 1 \
  --gpu-memory-utilization 0.975 \
  --max-model-len 1048576 \
  --max-num-seqs 16 \
  --max-num-batched-tokens 8192 \
  --max-cudagraph-capture-size 96 \
  --compilation-config {"cudagraph_mode":"FULL_AND_PIECEWISE","custom_ops":["all"]} \
  --async-scheduling \
  --no-scheduler-reserve-full-isl \
  --enable-chunked-prefill \
  --tokenizer-mode deepseek_v4 \
  --tool-call-parser deepseek_v4 \
  --reasoning-parser deepseek_v4 \
  --enable-auto-tool-choice \
  --enable-prompt-tokens-details \
  --enable-force-include-usage \
  --enable-request-id-headers \
  --default-chat-template-kwargs.thinking=true \
  --default-chat-template-kwargs.reasoning_effort=high \
  --enable-flashinfer-autotune \
  --enable-prefix-caching \
  --speculative-config {"model":"deepseek-ai/DeepSeek-V4-Flash-0731","method":"dspark","num_speculative_tokens":5,"draft_sample_method":"probabilistic","rejection_sample_method":"standard"} \
  --attention-backend B12X_MLA_SPARSE \
  --moe-backend b12x \
  --linear-backend b12x \
  --root-path /llm/api/

 

Ca tourne avec https://github.com/local-inference- [...] ark-v20.md car apparemment c'est pas supporté encore de base correctement dans VLLM


Message édité par M300A le 01-08-2026 à 22:34:31

---------------
:wq
n°43912
the_fennec
f3nn3cUs z3rd4
Posté le 01-08-2026 à 22:23:59  profilanswer
 

neo world a écrit :


 
j'ai vu aucune info sur une phase de pp plus rapide que le decode (le NPU ne doit servir à rien ici et les questions posées pour les benchs font genre 30 / 60 tokens  [:sid sidious:1] ). Ca evolue quand même assez vite (X2 en vitesse entre les premiers benchs et les dernières releases de colibri sur AMD AI Strix Halo) mais le Mac est largement avantagé grâce à la paire NVME et RAM plus rapide.
 
j'imagine que tu dois rattraper un peu la perf si tu passes en NVME PCI 5.0 mais je n'aurai pas ce plaisir comme je suis limité au PCI express 4.0. Y'a p't'être un truc à jouer en RAID0 mais je pense qu'une approche plus raisonnable (retravailler à partir de l'unsloth Dynamic 2-bit XXS ou UD-Q2_K_XL qui divise par plus de deux la taille du modèle) est plus viable.
 
Pour bosser au quotidien ça reste inutilisable. Vaut mieux partir sur le V4 flash avec des perfs beaucoup pratiques pour le quotidien :jap: :
https://www.reddit.com/r/LocalLLaMA [...] _ryzen_ai/


 
Moins de 100/s en PP c'est chaud, alors moins de 3 :lol: mais c'est pour le fun!
Enfin, moi avec mon SSD sata, je vais même pas tester  [:obanon]


---------------
Faudra que je teste un jour :o
n°43913
neo world
Posté le 01-08-2026 à 22:26:20  profilanswer
 

Tu veux peut être retirer ce qu'il y a derrière root@ ? :D
 
Ca se tourne pas les pouces sinon. Bravo :D
 
tu utilises quelle ligne de commande pour lancer l'inférence ?

n°43914
neo world
Posté le 01-08-2026 à 22:33:45  profilanswer
 

moi ça me semble carré. A ta place j'activerai l'autoboost mais il me semble pas que ça accélère la fréquence du HBM donc pas sur que tu en tireras plus de jus.
 
fait vérifier la ligne de commande de vllm par un pro mais là comme ça rien me choc dans ce que je suis capable d'interpréter :jap:

n°43915
neo world
Posté le 01-08-2026 à 22:37:44  profilanswer
 

the_fennec a écrit :


Enfin, moi avec mon SSD sata, je vais même pas tester  [:obanon]


tu te rapprocherais des 3 minutes + par token de la version réseau de deltafin :lol:  
 
j'ai vu aucun bench avec BC250 mais je pense que c'est simplement parce qu'il faut au minimum de quoi mettre le routage entre experts en ram ou VRAM pour que ça ne semble pas figé  [:zest:1]

n°43916
M300A
Posté le 01-08-2026 à 22:38:30  profilanswer
 

Oui j'ai viré le hostname mais bon rien de très secret encore une fois :D

 

Oé j'ai quand même bien galéré, comme d'hab, le KVM ipmi avec la moitié des touches qui marchent pas, nouveau qui me fait des kernels oops sur les blackwell sur le host et quo empêche systemd-udevd de démarrer : réseau qui monte pas au boot, et j'ai du me taper une self formation express sur les gros switch alcatel que je connais pas (ça fonctionne même pas en vlan c'est un truc propriétaire de chez eux).

 

Pas mal galéré aussi pour pré-charger le model depuis hugginface sur le host pour que le modèle le trouve dans le cache monté dans le docker et essaye pas d'aller sur le net (proxy...)

 

Et après j'ai bidouillé des params kernels car les cartes communiquaient pas entre elles et le chargement du modèle prenait des heures. Ca c'est opus qui a debuggé mais il y a une commande nvidia-smi qui affiche une matrice de communication entre les GPUs c'était pas si compliqué, une fois que le problème était identifié

 

Je suis content quand même :D
En tout cas du premier coup j'ai branché un OpenCode dedans et j'ai fait auditer un projet et ça a bien marché :D

 

Maintenant ça serait pas mal que je trouve une interface Web façon chat bot à coller dessus. Une idée ?


Message édité par M300A le 01-08-2026 à 22:42:12

---------------
:wq
n°43917
neo world
Posté le 01-08-2026 à 22:44:50  profilanswer
 
n°43919
neo world
Posté le 01-08-2026 à 23:38:00  profilanswer
 

Bordel je découvre que Alcatel fait toujours des Switchs. Le dernier que j'ai vu en entreprise c'était un hub 10Mb/s sur lequel on pouvait monter en ethernet ou en BNC (le truc était déjà décommissionné et prêt à être bazardé à mon premier jour  :pt1cable:  )

n°43920
M300A
Posté le 02-08-2026 à 01:06:08  profilanswer
 

Mieux non ?
 


(APIServer pid=7) INFO 08-01 23:00:54 [loggers.py:314] Engine 000: Avg prompt throughput: 2948.0 tokens/s, Avg generation throughput: 199.0 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 13.4%, Prefix cache hit rate: 61.7%
(APIServer pid=7) INFO 08-01 23:01:04 [loggers.py:314] Engine 000: Avg prompt throughput: 4596.4 tokens/s, Avg generation throughput: 304.5 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.4%, Prefix cache hit rate: 54.7%
(APIServer pid=7) INFO 08-01 23:01:14 [loggers.py:314] Engine 000: Avg prompt throughput: 10048.3 tokens/s, Avg generation throughput: 190.7 tokens/s, Running: 3 reqs, Waiting: 0 reqs, GPU KV cache usage: 10.7%, Prefix cache hit rate: 56.5%
(APIServer pid=7) INFO 08-01 23:01:24 [loggers.py:314] Engine 000: Avg prompt throughput: 4655.5 tokens/s, Avg generation throughput: 401.8 tokens/s, Running: 3 reqs, Waiting: 0 reqs, GPU KV cache usage: 8.7%, Prefix cache hit rate: 68.3%
(APIServer pid=7) INFO 08-01 23:01:34 [loggers.py:314] Engine 000: Avg prompt throughput: 2558.9 tokens/s, Avg generation throughput: 466.6 tokens/s, Running: 4 reqs, Waiting: 0 reqs, GPU KV cache usage: 2.0%, Prefix cache hit rate: 70.4%
(APIServer pid=7) INFO 08-01 23:01:44 [loggers.py:314] Engine 000: Avg prompt throughput: 210.1 tokens/s, Avg generation throughput: 582.5 tokens/s, Running: 4 reqs, Waiting: 0 reqs, GPU KV cache usage: 2.1%, Prefix cache hit rate: 72.2%
(APIServer pid=7) INFO 08-01 23:01:54 [loggers.py:314] Engine 000: Avg prompt throughput: 1477.4 tokens/s, Avg generation throughput: 437.5 tokens/s, Running: 4 reqs, Waiting: 0 reqs, GPU KV cache usage: 2.2%, Prefix cache hit rate: 77.7%
(APIServer pid=7) INFO 08-01 23:02:04 [loggers.py:314] Engine 000: Avg prompt throughput: 492.1 tokens/s, Avg generation throughput: 428.9 tokens/s, Running: 2 reqs, Waiting: 0 reqs, GPU KV cache usage: 1.1%, Prefix cache hit rate: 81.1%
(APIServer pid=7) INFO 08-01 23:02:14 [loggers.py:314] Engine 000: Avg prompt throughput: 827.7 tokens/s, Avg generation throughput: 431.2 tokens/s, Running: 4 reqs, Waiting: 0 reqs, GPU KV cache usage: 2.4%, Prefix cache hit rate: 84.6%
(APIServer pid=7) INFO 08-01 23:02:24 [loggers.py:314] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 575.4 tokens/s, Running: 3 reqs, Waiting: 0 reqs, GPU KV cache usage: 2.0%, Prefix cache hit rate: 84.6%
(APIServer pid=7) INFO 08-01 23:02:34 [loggers.py:314] Engine 000: Avg prompt throughput: 658.0 tokens/s, Avg generation throughput: 393.3 tokens/s, Running: 3 reqs, Waiting: 0 reqs, GPU KV cache usage: 2.0%, Prefix cache hit rate: 87.3%
(APIServer pid=7) INFO 08-01 23:02:44 [loggers.py:314] Engine 000: Avg prompt throughput: 261.2 tokens/s, Avg generation throughput: 425.6 tokens/s, Running: 3 reqs, Waiting: 0 reqs, GPU KV cache usage: 2.1%, Prefix cache hit rate: 88.0%
(APIServer pid=7) INFO 08-01 23:02:54 [loggers.py:314] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 473.3 tokens/s, Running: 2 reqs, Waiting: 0 reqs, GPU KV cache usage: 1.6%, Prefix cache hit rate: 88.0%
(APIServer pid=7) INFO 08-01 23:03:04 [loggers.py:314] Engine 000: Avg prompt throughput: 245.7 tokens/s, Avg generation throughput: 465.7 tokens/s, Running: 2 reqs, Waiting: 0 reqs, GPU KV cache usage: 1.3%, Prefix cache hit rate: 88.2%
(APIServer pid=7) INFO 08-01 23:03:14 [loggers.py:314] Engine 000: Avg prompt throughput: 1162.1 tokens/s, Avg generation throughput: 263.8 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.5%, Prefix cache hit rate: 88.0%
(APIServer pid=7) INFO 08-01 23:03:24 [loggers.py:314] Engine 000: Avg prompt throughput: 602.9 tokens/s, Avg generation throughput: 255.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.5%, Prefix cache hit rate: 88.2%
(APIServer pid=7) INFO 08-01 23:03:34 [loggers.py:314] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 155.1 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 88.2%
(APIServer pid=7) INFO 08-01 23:03:44 [loggers.py:314] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 0.0 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 88.2%
(APIServer pid=7) INFO 08-01 23:04:34 [loggers.py:314] Engine 000: Avg prompt throughput: 4064.3 tokens/s, Avg generation throughput: 0.0 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 14.4%, Prefix cache hit rate: 86.4%
(APIServer pid=7) INFO 08-01 23:04:44 [loggers.py:314] Engine 000: Avg prompt throughput: 1639.3 tokens/s, Avg generation throughput: 319.8 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.6%, Prefix cache hit rate: 86.6%


---------------
:wq
n°43921
neo world
Posté le 02-08-2026 à 01:38:17  profilanswer
 

Ça fait une belle amélioration ! Tu as fait quoi ?

n°43922
M300A
Posté le 02-08-2026 à 01:43:09  profilanswer
 

neo world a écrit :

Ça fait une belle amélioration ! Tu as fait quoi ?

 

Essentiellement iommu=pt sur le host, c'est ce qui a fait le gros gain. Après un tweak sur les channels NCCL qui à apporté un petit gain sur le temps de chargement du modèle donc je pense que ça peut pas faire de mal et du pinning numa sur la VM mais pas de gain visible.

 

Je suis pas sûr que je vais pouvoir faire mieux, c'est déjà très sympa par rapport à la lenteur de Claude :D
Et ça marche bien, j'ai fait des audits de code, un plan de migration d'une appli en changeant un lib avec migration de données et un bug fix sur une tresse grosse app avec un prompt d'une ligne en français. So far so good


Message édité par M300A le 02-08-2026 à 01:43:46

---------------
:wq
n°43923
neo world
Posté le 02-08-2026 à 01:44:57  profilanswer
 

[:moonblood]  
 
combien la bécane ?  :D

n°43924
M300A
Posté le 02-08-2026 à 02:02:57  profilanswer
 

Assez :o


---------------
:wq
n°43928
Plam
Bear Metal
Posté le 02-08-2026 à 08:47:55  profilanswer
 

C'est le bon combo, vLLM + OpenWebUI (ici on a aussi un LiteLLM au milieu ça permet d'avoir un « middleware » pour router comme on veut).
 
Tu peux découvrir les tools et les modèles custom dans OpenWebUI qui t'ouvrent des choses très intéressantes pour « spécialiser » ton modèle général avec des prompts spécifiques, thinking ou pas etc.


---------------
Spécialiste du bear metal
n°43933
Nr13
Posté le 02-08-2026 à 10:04:51  profilanswer
 

j'ai une question à moitié LLM local.  
Est-ce que des trucs comme OpenWebUi peuvent être utile pour centraliser la configuration/les outils utilisés par une petite équipe (10 personnes, postes variées, pas que du dev), y compris dans le cas de provider externes?
 
D'autant plus que c'est une situation où le décideur ne veut pas s'engager dans une solution particulière, vu comme tout bouge vite.. donc l'idée c'est d'être provider (voir modèle dans une certaine mesure) agnostique
 
Mais si c'est pour que les utilisateurs ralent car ils ne peuvent pas faire certains trucs inclus dans les abos claude ou gpt, hum.

n°43934
the_fennec
f3nn3cUs z3rd4
Posté le 02-08-2026 à 10:16:09  profilanswer
 

neo world a écrit :

Bordel je découvre que Alcatel fait toujours des Switchs. Le dernier que j'ai vu en entreprise c'était un hub 10Mb/s sur lequel on pouvait monter en ethernet ou en BNC (le truc était déjà décommissionné et prêt à être bazardé à mon premier jour  :pt1cable:  )


 
Vas dans des boites publique tu devrais encore en trouver :o Enfin moins maintenant que les restes d'Alcatel ont été vendus à des chinois, Nokia ou des fonds d'investissements.


---------------
Faudra que je teste un jour :o
n°43940
Plam
Bear Metal
Posté le 02-08-2026 à 10:34:44  profilanswer
 

Nr13 a écrit :

j'ai une question à moitié LLM local.  
Est-ce que des trucs comme OpenWebUi peuvent être utile pour centraliser la configuration/les outils utilisés par une petite équipe (10 personnes, postes variées, pas que du dev), y compris dans le cas de provider externes?
 
D'autant plus que c'est une situation où le décideur ne veut pas s'engager dans une solution particulière, vu comme tout bouge vite.. donc l'idée c'est d'être provider (voir modèle dans une certaine mesure) agnostique
 
Mais si c'est pour que les utilisateurs ralent car ils ne peuvent pas faire certains trucs inclus dans les abos claude ou gpt, hum.


 
Regarde du côté de LiteLLM. D'ailleurs c'est pas exclusif avec OpenWebUI and vLLM, ici j'ai :
 
Différents GPU -> vLLM sur différentes machines, parfois physique parfois en VM + PCI passthrough sur XCP-ng ------> LiteLLM (routing, clef d'accès individuelles à différents vLLM et potentiellement des trucs externes -------> OpenWebUI pour les usages plus "chatGPT like".
 
Les devs peuvent utiliser OpenCode avec une clef LiteLLM et on peut suivre les coûts et router comme il faut. La « plèbe » utilise quasi que OpenWebUI.
 
En cas d'ajout de GPU ou de maintenance/panne, tu peux utiliser LiteLLM pour router ailleurs.


---------------
Spécialiste du bear metal
n°43941
M300A
Posté le 02-08-2026 à 11:23:18  profilanswer
 

T'as combien de matos Plam ? J'ai l'air ridicule moi :D


---------------
:wq
n°43943
Plam
Bear Metal
Posté le 02-08-2026 à 11:36:31  profilanswer
 

M300A a écrit :

T'as combien de matos Plam ? J'ai l'air ridicule moi :D


 
Pas du tout, en prod pour la boîte j'ai que 2 RTX 6000 : un Ada et un Blackwell. Mais en vérité pour l'instant ça suffit, pour les gros trucs et 100% open source les devs sont sur Claude.
 
Par contre, tout ce qui est « petit » dev ou tout autre truc pertinent pour faire des « agents » (je met entre «» car c'est pas exactement ça), ça suffit encore largement.


---------------
Spécialiste du bear metal
n°43944
M300A
Posté le 02-08-2026 à 11:39:15  profilanswer
 

En tout cas je bricole avec le Ds5 Flash 0731 c'est de la folie, ca marche vraiment bien et la vitesse est vraiment cool :D


---------------
:wq
n°43946
Plam
Bear Metal
Posté le 02-08-2026 à 11:43:46  profilanswer
 

M300A a écrit :

En tout cas je bricole avec le Ds5 Flash 0731 c'est de la folie, ca marche vraiment bien et la vitesse est vraiment cool :D


 
Ta des éléments de comparaison eg par rapport à un Claude ?
 
Souvent on dit que le harness y fait aussi pour beaucoup, OpenCode est pas encore au niveau d'un Claude Code me dit on.


---------------
Spécialiste du bear metal
n°43950
Nr13
Posté le 02-08-2026 à 12:48:02  profilanswer
 

Merci pour les infos sur litellm, ça pourrait correspondre.
 
Concernant claude vs opencode, ça se discute manifestement, déjà apparemment claude bloat énormement niveau contexte et consommation de tokens.
 
Ex avec ds-flash justement (mais l'ancienne version) https://nqawhc.github.io/articles/h [...] t-quality/

 Page :   1  2  3  4  5  ..  27  28  29  30  31  32

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)