Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
4437 connectés 

 


Ma famille de modèles préferée du quotidien ...
Ce sondage expirera le 01-11-2026 à 10:00




Attention si vous cliquez sur "voir les résultats" vous ne pourrez plus voter

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  20  21  22  ..  75  76  77  78  79  80
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°40554
memaster
M.arc a volé mon 62
Posté le 27-06-2026 à 12:39:43  profilanswer
 

Reprise du message précédent :
j'avais pu vu ce thread, j'aurais du mettre ça ici [:eponge]  

memaster a écrit :

j'ai installé un autre assistant ollama/phi3 sur une autre machine pour comparer.
c'étrange, mais les 2 assistants n'ont pas le même comportement.
 
il y en a un : mon premier est très coopératif dans ce que je lui demande,
du genre des infos sur le sys et des commandes à tapper pour résoudre tel ou tel pb.
notamment sur openclaw...
 
le 2nd : le plus jeune essaye de me vendre des tokens de cloud alors que je lui dis qu'il tourne en local.
il arrete pas de me repeter que c'est microsoft à distance qui gère ses réponses...
 
hallucinant :pt1cable:


---------------
ma conduite intérieure .:R | memaster pilote officiel de la HFR Badoit-Auchan F1 Team | zéro tracas, zéro blabla MMa.ster
n°40555
memaster
M.arc a volé mon 62
Posté le 27-06-2026 à 12:43:09  profilanswer
 

WIP : je DL un gemma4 pour voir la différence avec phi3 qui me semble succint :D


---------------
ma conduite intérieure .:R | memaster pilote officiel de la HFR Badoit-Auchan F1 Team | zéro tracas, zéro blabla MMa.ster
n°40631
Fredouye
Shivers !
Posté le 28-06-2026 à 09:18:49  profilanswer
 

Je commence à jouer avec vLLM (et un petit modèle Qwen, en CPU) et LiteLLM, c'est de la folie ce truc  [:_otto_:5]


---------------
Le dernier arrivé est fan de Phil Collins
n°40636
Pipould's
Posté le 28-06-2026 à 10:40:51  profilanswer
 

Fredouye a écrit :

Je commence à jouer avec vLLM (et un petit modèle Qwen, en CPU) et LiteLLM, c'est de la folie ce truc  [:_otto_:5]

 

Par rapport à quoi ?

n°40642
the_fennec
f3nn3cUs z3rd4
Posté le 28-06-2026 à 11:48:28  profilanswer
 

memaster a écrit :

j'avais pu vu ce thread, j'aurais du mettre ça ici [:eponge]  


 
Les fichiers d'init d'OC changent avec le temps, donc le "tempérament" d'un agent sera pas toujours le même. Ce que tu peux essayer c'est de copier/coller les fichiers de l'agent qui te plais dans l'install de l'autre.


---------------
Faudra que je teste un jour :o
n°40651
memaster
M.arc a volé mon 62
Posté le 28-06-2026 à 14:05:03  profilanswer
 

c'est quoi OC? sisi je débute :sleep:


---------------
ma conduite intérieure .:R | memaster pilote officiel de la HFR Badoit-Auchan F1 Team | zéro tracas, zéro blabla MMa.ster
n°40668
ibuprophet
Posté le 28-06-2026 à 16:00:04  profilanswer
 

je mets une pièce sur OpenCode

n°40672
Nr13
Posté le 28-06-2026 à 16:30:03  profilanswer
 

plutot openclaw, de base sur opencode la config est "statique" (modifiable évidemment mais explicitement)

n°40707
the_fennec
f3nn3cUs z3rd4
Posté le 28-06-2026 à 18:30:45  profilanswer
 

memaster a écrit :

c'est quoi OC? sisi je débute :sleep:


 
Oui, Openclaw, j'avais la flemme de tout taper :o


---------------
Faudra que je teste un jour :o
n°40718
neo world
Posté le 28-06-2026 à 19:21:22  profilanswer
 

Intel qui revient dans la course de l'inférence de gros modèles : https://pausehardware.com/crescent- [...] r5x-intel/  
 
Le cluster d'1TB avec deux cartes :love:
 
le prix  [:rarnomix:4], la vitesse d'inférence du bousin [:deouss], mon GLM 5.2 ... [:dovakor_:2]

n°40728
the_fennec
f3nn3cUs z3rd4
Posté le 28-06-2026 à 20:21:25  profilanswer
 

C'est pas un peu du gâchis de RAM? Tout ça pour avoir 3tg/s :o
Quitte a mettre de la DDR5, autant la mettre en CAMM ou en SODIMM.


Message édité par the_fennec le 28-06-2026 à 20:22:50

---------------
Faudra que je teste un jour :o
n°40739
neo world
Posté le 28-06-2026 à 22:31:04  profilanswer
 

je suis aussi perplexe que toi mais j'imagine qu'ils ont un plan pour en tirer plus de 10 tokens / seconde
 
Lequel ça ... :o

n°40740
memaster
M.arc a volé mon 62
Posté le 28-06-2026 à 22:37:26  profilanswer
 

the_fennec a écrit :


 
Oui, Openclaw, j'avais la flemme de tout taper :o


ah d'accord, j'étais parti ailleurs  :(  alors que c'était simple.
bon pour le moment j'ai mis openclaw à la poubelle car il plantait avec mes modèles sur ma quadro (même avec phi3 le plus léger)
j'utilise directement ollama run monmodel en 100% cpu.
je teste d'abord plusieurs différents pour voir celui me correspond le mieux.
 
je vais revenir avec openclaw dès que j'aurais défini le pb. Même si j'ai l'impression que ma version de cuda pose pb. [:sniperlk]


---------------
ma conduite intérieure .:R | memaster pilote officiel de la HFR Badoit-Auchan F1 Team | zéro tracas, zéro blabla MMa.ster
n°40741
KaneZe
Posté le 28-06-2026 à 22:46:43  profilanswer
 

J'ai installé LM studio et Hermes agent sur mon pc, qui me sert surtout pour le JV. Il est sur une bas de I5 14600k, RTX 3090, 64gb DDR5. J'ai pris gemma 4 24b du coup. C'est plutôt sympa pour l'instant, mais je débute:)

n°40745
the_fennec
f3nn3cUs z3rd4
Posté le 29-06-2026 à 00:06:31  profilanswer
 

neo world a écrit :

je suis aussi perplexe que toi mais j'imagine qu'ils ont un plan pour en tirer plus de 10 tokens / seconde
 
Lequel ça ... :o


 
Pas vu encore, mais WTF le GPU Kamoulox :love:  
https://youtu.be/-fZM9wOvbh0
 
https://i.imgur.com/DEaCm5S.jpeg
 
Leur ingé hardware a éternué sur la clavier quand il a choisis les connecteurs :o


---------------
Faudra que je teste un jour :o
n°40746
the_fennec
f3nn3cUs z3rd4
Posté le 29-06-2026 à 00:09:43  profilanswer
 

memaster a écrit :


ah d'accord, j'étais parti ailleurs  :(  alors que c'était simple.
bon pour le moment j'ai mis openclaw à la poubelle car il plantait avec mes modèles sur ma quadro (même avec phi3 le plus léger)
j'utilise directement ollama run monmodel en 100% cpu.
je teste d'abord plusieurs différents pour voir celui me correspond le mieux.
 
je vais revenir avec openclaw dès que j'aurais défini le pb. Même si j'ai l'impression que ma version de cuda pose pb. [:sniperlk]


 
CUDA 13.0/1/2 a un soucis de modèles qui partent en couille, fixé en 13.3, mais perso j'ai pas eu de soucis ... mais si je suis en Vulkan maintenant.


---------------
Faudra que je teste un jour :o
n°40747
the_fennec
f3nn3cUs z3rd4
Posté le 29-06-2026 à 00:10:10  profilanswer
 

KaneZe a écrit :

J'ai installé LM studio et Hermes agent sur mon pc, qui me sert surtout pour le JV. Il est sur une bas de I5 14600k, RTX 3090, 64gb DDR5. J'ai pris gemma 4 24b du coup. C'est plutôt sympa pour l'instant, mais je débute:)


 
Welcome  :jap:


---------------
Faudra que je teste un jour :o
n°40748
neo world
Posté le 29-06-2026 à 00:18:09  profilanswer
 

the_fennec a écrit :


 
Pas vu encore, mais WTF le GPU Kamoulox :love:  
https://youtu.be/-fZM9wOvbh0
 
https://i.imgur.com/DEaCm5S.jpeg
 
Leur ingé hardware a éternué sur la clavier quand il a choisis les connecteurs :o


ça prend beaucoup de confiance de choisir un connecteur 400Gb en tous cas :D

n°40752
the_fennec
f3nn3cUs z3rd4
Posté le 29-06-2026 à 08:49:14  profilanswer
 

neo world a écrit :


ça prend beaucoup de confiance de choisir un connecteur 400Gb en tous cas :D


 
Pas fini la vidéo encore, GN parle beaucoup :o
 
Quelques specs:
32GB de LPDDR5x
extensible en DDR5 UMA, latence 100ns meilleure que HMD/GDDR
il y a un CPU RiskV5 dans le GPU!
archi chiplet on peut mettre 4x GPU sur la même carte
le port pcie (standard) sert a faire du SLI
port 1GBs BMC pour le management, updates de firmware, contrôle on/off d'une flotte de cartes
protos en fin d'année, prod l'année prochaine
orienté pro d'abord, gaming ensuite, mais cible "low cost"


---------------
Faudra que je teste un jour :o
n°40753
KaneZe
Posté le 29-06-2026 à 10:00:54  profilanswer
 

the_fennec a écrit :


 
Pas fini la vidéo encore, GN parle beaucoup :o
 
Quelques specs:
32GB de LPDDR5x
extensible en DDR5 UMA, latence 100ns meilleure que HMD/GDDR
il y a un CPU RiskV5 dans le GPU!
archi chiplet on peut mettre 4x GPU sur la même carte
le port pcie (standard) sert a faire du SLI
port 1GBs BMC pour le management, updates de firmware, contrôle on/off d'une flotte de cartes
protos en fin d'année, prod l'année prochaine
orienté pro d'abord, gaming ensuite, mais cible "low cost"


J'anticipe de beaucoup mon propre usage, mais une carte comme celle là, si je comprends bien, décharge sur la carte l'ensemble des données sur lequel l'agent bosse. Et si je prend l'exemple de lui demander  un travail en fin de nuit sur X actions que j'attends et que j'aimerai voir mise en forme (CR vocal, ou alimentation d'un dashboard, peut importe) pour l'instant je coupe mon LM Studio en fin de soirée car hors de question de laisser mon pc tourner de nuit. Or si une carte qui a suffisamment de "humppff" pour tourner sur une machine moins energivore qu'un pc de gaming avec une RTX3090 existe, à long terme ca peut valoir le coup:)

n°40754
neo world
Posté le 29-06-2026 à 10:12:19  profilanswer
 

tu demandes à ton LLM de coder un script qui fait tourner nv smi toutes les minutes et si la charge descend à 0% sur 10 minutes de faire un shutdown.
 
J'ai trouvé un nom pour le script : la-belle-au-bois-dormant.ps (si windows) :D

Message cité 1 fois
Message édité par neo world le 29-06-2026 à 10:12:40
n°40756
the_fennec
f3nn3cUs z3rd4
Posté le 29-06-2026 à 10:31:11  profilanswer
 

KaneZe a écrit :


J'anticipe de beaucoup mon propre usage, mais une carte comme celle là, si je comprends bien, décharge sur la carte l'ensemble des données sur lequel l'agent bosse. Et si je prend l'exemple de lui demander  un travail en fin de nuit sur X actions que j'attends et que j'aimerai voir mise en forme (CR vocal, ou alimentation d'un dashboard, peut importe) pour l'instant je coupe mon LM Studio en fin de soirée car hors de question de laisser mon pc tourner de nuit. Or si une carte qui a suffisamment de "humppff" pour tourner sur une machine moins energivore qu'un pc de gaming avec une RTX3090 existe, à long terme ca peut valoir le coup:)


 
Oui c'est l'idée, mais si la carte vaut 1000 euros, ce qui ne serait vraiment pas chère pour un GPU 32GB extensible, il faut faire tourner le truc quelques années pour que ça soit rentable...
Est-ce que c'est pas plus rentable de tuner le PC gamer pour être silencieux/économe? Tu peux undervolt, et downclock pendant l'inférence, couper tes RGBs, etc :o  
 

neo world a écrit :

tu demandes à ton LLM de coder un script qui fait tourner nv smi toutes les minutes et si la charge descend à 0% sur 10 minutes de faire un shutdown.
 
J'ai trouvé un nom pour le script : la-belle-au-bois-dormant.ps (si windows) :D


 
Ou tu fais confiance a l'IA et lui dit de lancer un shutdown a la fin :D


---------------
Faudra que je teste un jour :o
n°40757
neo world
Posté le 29-06-2026 à 10:34:10  profilanswer
 

the_fennec a écrit :


 
Ou tu fais confiance a l'IA et lui dit de lancer un shutdown a la fin :D


 [:shlavos]

n°40758
KaneZe
Posté le 29-06-2026 à 10:39:42  profilanswer
 

the_fennec a écrit :


 
Oui c'est l'idée, mais si la carte vaut 1000 euros, ce qui ne serait vraiment pas chère pour un GPU 32GB extensible, il faut faire tourner le truc quelques années pour que ça soit rentable...
Est-ce que c'est pas plus rentable de tuner le PC gamer pour être silencieux/économe? Tu peux undervolt, et downclock pendant l'inférence, couper tes RGBs, etc :o  
 
C'est une énorme tour watercoolé custom, donc dans l'idée un pc bien plus petit a tellement plus de sens. Et tout est à calibrer en fonction de l'usage:)


 

the_fennec a écrit :


 
Ou tu fais confiance a l'IA et lui dit de lancer un shutdown a la fin :D


n°40759
the_fennec
f3nn3cUs z3rd4
Posté le 29-06-2026 à 11:12:51  profilanswer
 

Citation :

C'est une énorme tour watercoolé custom, donc dans l'idée un pc bien plus petit a tellement plus de sens. Et tout est à calibrer en fonction de l'usage:)


 
A toi de voir :jap:, c'est juste que le moindre système de base capable de faire de l'inférence, est largement a plus de 1000/1500 euros avec 32GB de DDR5, 1TB de SSD et un GPU convenable. Sachant qu'Apple est en train de monter les prix, ça sera même plus la solution économique et silencieuse ...


---------------
Faudra que je teste un jour :o
n°40801
croustx
Modoadorateur
Posté le 29-06-2026 à 14:52:09  profilanswer
 

Vous avez des retours sur les LLM "cpu only" ?
Ca me semble être le moins cher pour choper de la grosse quantité de RAM

n°40806
lapin
Posté le 29-06-2026 à 15:02:48  profilanswer
 

croustx a écrit :

Vous avez des retours sur les LLM "cpu only" ?
Ca me semble être le moins cher pour choper de la grosse quantité de RAM


 
 
Sur très très gros CPU serveur genre Threadripper très récent genre du 7000 séries, mais à mon avis ce serait cher et très très lent face à du nVIDIA Geforce RTX-3000 séries et RTX-4000 Series, et surement face a du RX-7000 séries.
 
Et en plus rien que le CPU genre Threadripper ce serait à 4000€ boulles le CPU et 650€ Boulles la carte mère, et avec y a pas le prix de la RAM.

n°40813
the_fennec
f3nn3cUs z3rd4
Posté le 29-06-2026 à 15:38:42  profilanswer
 

croustx a écrit :

Vous avez des retours sur les LLM "cpu only" ?
Ca me semble être le moins cher pour choper de la grosse quantité de RAM


 
Si tu as déjà un système avec beaucoup de RAM, tu peux regarder ik_llama:
https://github.com/ikawrakow/ik_llama.cpp
 
Mais a moins d'avoir l'utilité d'un gros système avec beaucoup de RAM pour autre chose j'investirais pas la dedans. D'ailleurs tu peux essayer de voir ce que ça donne sur ton système actuel, si tu as 32GB tu peux essayer Gemma4 26B qat pour voir.
 
Pour mettre en perspective ce que dis lapin, une RTX 5050 a 2560 CUDA cores :o


---------------
Faudra que je teste un jour :o
n°40819
ibuprophet
Posté le 29-06-2026 à 16:33:46  profilanswer
 

Et il te faudra un max de RAM.
 
Perso avec les 2 nvidia 32+16 + 96Go de RAM je suis encore trop short pour tester les modèles dits "small" en Q4. Et ces derniers sont à peines meilleurs que qwen3.6 27B qui tourne en mode TGV sur la 5090.

n°40820
memaster
M.arc a volé mon 62
Posté le 29-06-2026 à 16:44:59  profilanswer
 

croustx a écrit :

Vous avez des retours sur les LLM "cpu only" ?
Ca me semble être le moins cher pour choper de la grosse quantité de RAM


il n'existe pas de LLM purement dédié à l'un ou l'autre.
il se place dans l'espace RAM/CPU, si les gestionnaire ne trouve pas de computing VRAM/GPU.


---------------
ma conduite intérieure .:R | memaster pilote officiel de la HFR Badoit-Auchan F1 Team | zéro tracas, zéro blabla MMa.ster
n°40827
lapin
Posté le 29-06-2026 à 18:31:09  profilanswer
 

croustx a écrit :

Vous avez des retours sur les LLM "cpu only" ?
Ca me semble être le moins cher pour choper de la grosse quantité de RAM


 
 
Par contre un point tu poses cette question-ci:  
 
Comment programmé en C++ liste des variables et structure du langage C++
 
Sous LM Studio avec la base Gemma-4 e4b taille du modèle 6.33 GByte les modèles plus lourds font crashé la Carte Graphique avec un jolie écran noir.
 
Et en 2,29 Seconde Gemma-4 e4b taille du modèle 6.33 GByte via LM Studio  
https://docs.google.com/document/d/ [...] sp=sharing
Vérifier ce que LM Stuidio à généré car je n'y comprends rien, si ça se trouve, il m'a dit que des conneries.
 
Y a bien 6.3 Gbytes de VRAM consommés, et LM STUDIO consomme  1564.8 Mega Octet de RAM.
 
Autre point ça ne consomme quasiment aucunes ressources CPU et GPU, juste un peu de VRAM.
Pour information, j'ai HBCC d'activé.
 
Donc pas forcément besoin d'un très gros CPU ni GPU, après ça dépend de ce que tu lui demandes de faire.

n°40829
the_fennec
f3nn3cUs z3rd4
Posté le 29-06-2026 à 18:56:02  profilanswer
 

lapin a écrit :

 


Par contre un point tu poses cette question-ci:

 

Comment programmé en C++ liste des variables et structure du langage C++

 

Sous LM Studio avec la base Gemma-4 e4b taille du modèle 6.33 GByte les modèles plus lourds font crashé la Carte Graphique avec un jolie écran noir.

 

Et en 2,29 Seconde Gemma-4 e4b taille du modèle 6.33 GByte via LM Studio
https://docs.google.com/document/d/ [...] sp=sharing
Vérifier ce que LM Stuidio à généré car je n'y comprends rien, si ça se trouve, il m'a dit que des conneries.

 

Y a bien 6.3 Gbytes de VRAM consommés, et LM STUDIO consomme  1564.8 Mega Octet de RAM.

 

Autre point ça ne consomme quasiment aucunes ressources CPU et GPU, juste un peu de VRAM.
Pour information, j'ai HBCC d'activé.

 

Donc pas forcément besoin d'un très gros CPU ni GPU, après ça dépend de ce que tu lui demandes de faire.

 

Je comprends rien de ce que tu veux dire.


---------------
Faudra que je teste un jour :o
n°40831
lapin
Posté le 29-06-2026 à 19:10:53  profilanswer
 

the_fennec a écrit :


 
Je comprends rien de ce que tu veux dire.


 
 
Je dis juste que si tu poses des questions faibles et basiques à un LLM Local sur un ordinateur, ben y a pas besoin d'un gros GPU ni beaucoup de VRAM.
Il n'y avait aucune charge GPU et CPU lors de la génération du langage pour la réponse, et il a répondu de manière complète et en 2,29 secondes, pour l'exactitude des réponses je ne sais pas par contre.
 
Après si y a des benchmarks de test en local, je veux bien benchmarker ma config et LM Studio et gemma-4 e4b, afin de comparer la qualité des réponses et la vitesse auquel il répond.

n°40832
yohaskan
Posté le 29-06-2026 à 19:13:03  profilanswer
 

the_fennec a écrit :


 
Je comprends rien de ce que tu veux dire.


ah toi aussi ?
j'ai même ouvert le google doc auquel je m’attendais a un log mais...
 
C'est quoi la question en faite?  
Probleme de Vram ?  
Quel est le model de carte ?
C'est sur que si tu bouffes toute ta Vram avec un LLM et que tu laisse rien au systeme... ca peut causer des problemes

n°40836
the_fennec
f3nn3cUs z3rd4
Posté le 29-06-2026 à 19:29:52  profilanswer
 

lapin a écrit :

Je dis juste que si tu poses des questions faibles et basiques à un LLM Local sur un ordinateur, ben y a pas besoin d'un gros GPU ni beaucoup de VRAM.
Il n'y avait aucune charge GPU et CPU lors de la génération du langage pour la réponse, et il a répondu de manière complète et en 2,29 secondes, pour l'exactitude des réponses je ne sais pas par contre.
 
Après si y a des benchmarks de test en local, je veux bien benchmarker ma config et LM Studio et gemma-4 e4b, afin de comparer la qualité des réponses et la vitesse auquel il répond.


 
OK :jap:.
 
En fait ça dépends beaucoup de la taille du contexte, et donc de l'agent que tu utilises. Par exemple claude-code va facilement t'ajouter 50k de contexte pour répondre a un simple bonjour, la ou le UI web de llama.cpp va te mettre 100 tokens de contexte et tu auras une réponse rapide. Je connais pas le prompt système de LMStudio, je sais pas combien il rajoute.
 
Ensuite, même avec un petit contexte de départ, les perfs se cassent bien la gueule quand tu commences a le remplir (en phase de prompt processing).


---------------
Faudra que je teste un jour :o
n°40851
lapin
Posté le 29-06-2026 à 21:36:25  profilanswer
 

yohaskan a écrit :


ah toi aussi ?
j'ai même ouvert le google doc auquel je m’attendais a un log mais...
 
C'est quoi la question en faite?  
Probleme de Vram ?  
Quel est le model de carte ?
C'est sur que si tu bouffes toute ta Vram avec un LLM et que tu laisse rien au systeme... ca peut causer des problemes


 
 
Ben j'ai une AMD RADEON RX-VEGA56 avec 8GO de VRAM, le HBCC porté à 14 GO, le modèle langage n'est qu'en VRAM mais le HBCC permet de mieux remplir la VRAM, j'aurais été plus limité sans HBCC.
 
En fait la question c'est quelles sont les ressources de puissance de GPU nécessaires pour de l'IA en local via LM Studio, sachant qu'on peut au moins mettre 6.33 GO de modèle de langage.
Je suppose que c'est fonction de la complexité des questions posées au modèle d'IA.
 
Là avec la question que j'avais posée à gemma4 e4B taille 6,33 GO, le vue mettre des ressources GPU n'ont même pas bronché, et pareil niveau CPU.
 
Oui, j'avais tenté 9 GO ça a crashé Directement,  Windows 11 a immédiatement récupéré les drivers graphiques, pas de crash lourd qui imposerait un arrêt de l'ordinateur.
 
En fait je ne sais pas ce que je peux faire avec la configuration que j'ai quel sont les limitations.
 
Je sais que mon GPU n'est pas compatible avec ROCm, et que LM Studio passe par Vulkan pour faire fonctionner le modèle Gemma4 e4b.
 
 
 

n°40873
yohaskan
Posté le 30-06-2026 à 10:51:49  profilanswer
 

Hum, j'utilise Cline LM Studio, mais avec une CG Nvidia Blackwell donc pas de cache HBCC d'AMD.  
Ce que je contrôle si je veux avoir le max de Token/s en assignant tout les layers du LLM au GPU,  
C’est de ne jamais dépasser 1Go en mémoire partagé ( ce n'est pas la VRAM dédié ) quand j'ajuste le Context length du LLM
 
Tu peux aussi décharger quelques layers sur la RAM / CPU pour avoir plus de Context length au détriment du débit Token/s évidemment  
 
ça devrait aussi marcher avec AMD  
voir ici depuis windows task manager, l'info de la mémoire partagé :
https://www.informatique-secours.com/divers/images/gpu_partagee.png
 
Tu lui assignais combien de Context length depuis Cline ?

Message cité 1 fois
Message édité par yohaskan le 30-06-2026 à 11:37:09
n°40874
lapin
Posté le 30-06-2026 à 11:29:57  profilanswer
 

yohaskan a écrit :

Hum, j'utilise Cline mais avec une CG Nvidia Blackwell donc pas de cache HBCC d'AMD.  
Ce que je contrôle si je veux avoir le max de Token/s en assignant tout les layers du LLM au GPU,  
C’est de ne jamais dépasser 1Go en mémoire partagé ( ce n'est pas la VRAM dédié ) quand j'ajuste le Context length du LLM
 
Tu peux aussi décharger quelques layers sur la RAM / CPU pour avoir plus de Context length au détriment du débit Token/s évidemment  
 
ça devrait aussi marcher avec AMD  
voir ici depuis windows task manager, l'info de la mémoire partagé :
https://www.informatique-secours.co [...] rtagee.png
 
Tu lui assignais combien de Context length depuis Cline ?


 
 
J'utilise l'application LM Studio
 
Le LLM c'est gemma-4-e4b.
Taille : 6,33 Gbytes.
Longueur de contexte: 8192, dois-je l'augmenter, dois-je le baisser.
En 131072 tokens, pareil en Tokens dois-je l'augmenter ou le baisse, je n'en sais rien.
Déchargement GPU:42, c'est peut être trop haut du coup, c'est peut être pour ça que la charge est faible.
CPU Thread Pool Size-24, je ne sais pas ce que c'est, mais à titre d'information mon CPU est un AMD THREADRIPPER 3970X et 32 GO de RAM.
Taille de lot d'Evaluation-2048, je ne sais pas j'ai laissé par défaut.
Physical Batch Size: 512, je ne sais pas ce que j'ai droit de faire avec
Base de Fréquence RoPE: Auto.
Échelle de Fréquence RoPE: Auto.
Offload KV Cache to GPU Memory: Activé.
 
https://www.dropbox.com/scl/fi/3g8kx6wksfq7ffyhyc6j7/gemma-4-e4b-taille-6.33-GBytes-Longue-de-contexte-8192-131072-tokens-Dechargement-gpu-42-CPU-Thread-Pool-Size-24-taille-de-lot-d-evaluation-2048-Physical-Batch-Size-512.png?rlkey=pn8ig17hg28gikuxoazp94y4u&st=2soduktn&dl=1
 
 
Si vous avez des tests de prompte Génériques qui me permettraient de faire un benchmark de LM Studio avec gemma-4-e4b avec mon ordinateur en local, ça m'aiderait grandement.

n°40875
yohaskan
Posté le 30-06-2026 à 11:55:48  profilanswer
 

Erreur de ma part je parlais de LM Studio aussi, ( Cline l'utilise en server API)
- Je peux te donner mon Bench avec gemma-4-E4B-it-Q8_0.gguf, mais bon en CUDA RTX 5090, tu auras évidemment pas les même perf. :
Tous les 42 layers decharger sur le GPU et 8192 de Longueur de contexte:  168.24 t/s
 
Pour info :
 si j'envoie tout les layers sur le CPU/RAM : 10t/s
 si je décharge juste 30 layers sur le GPU et le reste sur le CPU/RAM : 31t/s
 
- Dans cette même fenêtre de load de LM Studio, tu as le Flash attention d'activé ? (plus bas)
 

n°40878
lapin
Posté le 30-06-2026 à 14:55:30  profilanswer
 

Alors en fait gemini ma explique qu'en fait, c'est pas 3D qu'il faut afficher dans le vue mettre du gestionnaire des taches de windows 11.
 
Mais Compute 0 c'est lui qui charge et sur se prompt de test que m'a préparé gémini:
 
edit: la charge GPU sur Compute 0 était de 92% quasiment tout du long des calculs juste un petit décrochage un peu avant.
 

Citation :


Rédige une histoire de science-fiction détaillée en 8 paragraphes. Le thème est le voyage d'un archéologue spatial découvrant une immense structure abandonnée en orbite autour d'une étoile mourante. Sois très descriptif sur l'ambiance visuelle et technologique.


 
et avec les réglages que j'avais donnée précédement le texte généré à été fait en:
 
36,56 Tokens par secondes pour un total de 1265 Tokens et 46 secondes, Stop Reasons: EOS Token Found.
 
Voir le texte généré par gemma 4 e4b taille 6,33 GO, pas lu mais je pense que c'est de la merde niveau stagiaire de 6ième B au collège:
 

Spoiler :


Le *Vent des Temps Perdus*, un vaisseau d'exploration de classe archéologique, fendait l'obscurité veloutée de l'espace intersidéral. À bord, le Dr Aris Thorne, un expert en civilisations perdues et en technologies non-terrestres, ne voyait qu'une anomalie sur ses écrans : une signature énergétique colossale, stationnée dans la zone de décomposition d'une étoile mourante. L'étoile hôte, nommée Aethera, n'était plus qu'un géant rouge palpitant, son rayonnement s'étalant en ondes cramoisies et imprévisibles qui peignaient l'orbite environnante d'une lumière funéraire et dramatique. Au centre de ce spectacle cosmique se tenait la source du signal : une structure dont les dimensions défiaient toute compréhension architecturale humaine.
 
En réduisant la distance, Aris fut confronté au panorama impossible qu'était l’artefact. Il s'agissait d'une citadelle orbitale, une machine de taille continentale, faite de matériaux sombres et iridescents qui absorbaient presque la lumière de l'étoile agonisante. Des baies de verre cristallin, désormais opaques et criblées de craquelures, s'étendaient comme les vitraux brisés d'une cathédrale cosmique oubliée. La structure n'était pas faite de béton ou de métal connu; elle semblait être tissée à partir d'un alliage exotique qui changeait subtilement de teinte en fonction des courants gravitationnels, passant du noir jais au violet profond.
 
Le *Vent* effectua une manœuvre prudente et s'immobilisa devant la façade principale. Les scanners sophistiqués d'Aris se mirent à crépiter, déversant sur l'écran des flux de données impossibles : aucune lecture de technologie énergétique courante, aucun marqueur temporel cohérent. C'était comme regarder un mécanisme incroyablement complexe et totalement désassemblé. Des passerelles monumentales, autrefois propulsemotives et vibrantes d'une énergie inconnue, étaient maintenant figées dans une immobilité millénaire, recouvertes de dépôts de poussière stellaire incandescente qui leur conféraient l'aspect de givre magique.
 
Aris ordonna à son drone d'exploration, le *Némésis*, de pénétrer la structure. L'entrée se fit par un portail gigantesque, en forme de fleur stylisée, dont les jointures massives s’ouvrirent avec le bruit sourd et grave du métal qui n'a pas été sollicité depuis des éons. À l'intérieur, l'atmosphère était étrangement calme, chargée d'un champ électromagnétique résiduel qui chatouillait la coque du drone. La lumière ne venait ni des lampes, ni des panneaux solaires, mais semblait émaner de la matière elle-même : une douce bioluminescence bleutée et pulsatile qui balayait les couloirs voûtés comme le souffle d'un dieu endormi.
 
Les allées étaient bordées d'installations que l'archéologue n'avait jamais vues. Des consoles monolithiques, sculptées pour des interfaces neuronales plutôt que manuelles, s'alignaient en rangs ordonnés. Sur ces surfaces, des motifs luminescents complexes — une sorte de syntaxe physique et mathématique — pulsaient faiblement, comme si les connaissances y étaient toujours suspendues, attendant un déchiffrage. C'était le musée d'une race qui avait atteint un niveau de civilisation au-delà de la nécessité matérielle.
 
En avançant plus profondément dans ce labyrinthe cristallin, Aris réalisa que l'échelle était écrasante. La structure n'était pas seulement une station; c'était probablement le cœur d'un empire entier, une bibliothèque et un centre névralgique interconnecté. Il repéra de gigantesques puits verticaux qui plongeaient dans la masse centrale du vaisseau, révélant des niveaux encore plus bas, des couches technologiques si anciennes qu'elles semblaient avoir été intégrées à la gravité elle-même.
 
C'est au centre que le *Némésis* s'arrêta devant ce qui devait être une chambre de contrôle ou un observatoire principal. Devant eux gisait l'élément le plus troublant : un mécanisme sphérique colossal, suspendu dans un champ de stase énergétique parfaitement maintenu. La sphère était faite d'un cristal noir parfait, traversé par des failles dorées qui ressemblaient aux veines d'une créature géante. C'était un cœur technologique, encore fonctionnel, mais silencieux et endormi.
 
Aris s'adossa contre le dossier du *Vent*, respirant lentement l'air recyclé saturé de la poussière des âges. La structure n'était pas en ruine; elle était simplement suspendue entre deux états d'existence : celle du sommet technologique absolu et celle du silence éternel. Devant lui, dans le crépuscule rougeoyant de l'étoile agonisante, résidait le secret d'une espèce dont la chute avait été aussi monumentale que leur ascension. Il savait que cette découverte allait redéfinir l'histoire galactique pour toujours.
 


 
 
Et pour le prompte suivant:
 

Citation :


trois personnes (A, B et C) sont dans une pièce. A regarde B. B regarde C. A est marié, C n'est pas marié. Est-ce qu'une personne mariée regarde une personne non mariée ? Réponds par Oui, Non, ou 'On ne peut pas savoir', puis explique ton raisonnement étape par étape.


 
google/gemma-4-e4b
Thought for 17.85 seconds:
 
 
 
En 37,06 Tokens par Seconde, 1027 Tokens, en 47 secondes, Stop Reasons: EOS Token Found.
 
Réponse de gemma 4 e4b taille de 6,33 GO.

Spoiler :


On ne peut pas savoir
 
***
 
### Raisonnement étape par étape :
 
1.  **Identifier les faits connus concernant le statut matrimonial :**
    *   A est marié (Statut : Marié).
    *   C n'est pas marié (Statut : Non marié).
    *   Le statut de B est inconnu (Marié ou Non marié).
 
2.  **Identifier les interactions de regards possibles :**
    Il y a deux lignes de vue établies :
    *   A regarde B.
    *   B regarde C.
 
3.  **Analyser l'interaction A $\to$ B :**
    *   Le regard vient d'une personne mariée (A).
    *   Le destinataire du regard est B, dont le statut matrimonial est inconnu.
    *(Il pourrait s'agir de M $\to$ M ou de M $\to$ U.)*
 
4.  **Analyser l'interaction B $\to$ C :**
    *   Le destinataire du regard est une personne non mariée (C).
    *   La source du regard est B, dont le statut matrimonial est inconnu.
    *(Il pourrait s'agir de M $\to$ U ou de U $\to$ U.)*
 
5.  **Conclusion :**
    Puisque nous ne connaissons pas le statut marital de la personne B, et que ce statut est crucial pour déterminer si l'une des interactions observées correspond à un "marié qui regarde un non marié", il est impossible d'affirmer oui ou non.


 
Troisième et dernier prompt de test:
 
 

Citation :


Agis comme un analyste de données. Je vais te donner une liste de faits, retiens-les bien.
Fait 1 : Le projet Alpha a un budget de 15 000€.
Fait 2 : Le projet Beta est supervisé par Julie.
Fait 3 : Le projet Gamma est en retard de 3 semaines.
[Copiez-collez ici un long texte quelconque d'une page, comme un article de journal ou une documentation technique pour remplir le contexte]
En te basant uniquement sur les trois faits donnés au tout début, quel est le statut du projet de Julie et quel est le budget total mentionné ?


 
google/gemma-4-e4b dit Thought for 12.38 seconds:
 
Charge GPU sur Compute 0 est de 92% à 94% environ.
 
En 36,73 Tokens par seconde, 950 tokens, en 54 secondes, Stop Reasons : EOS Token Found.
 
Là je ne saurais dire si la qualité du traitement est bonne ou pas je n'ai pas le niveau scolaire requis
 

Spoiler :


En tant qu'analyste de données, j'ai bien retenu les faits initiaux et je vais effectuer l'analyse en ne considérant que ces trois points de données. Le texte de contexte qui suit est ignoré pour cette analyse car la consigne exige une limitation stricte aux seuls faits fournis au début.
 
---
 
### Analyse des Données
 
**Données disponibles (Scope limit):**
*   Fait 1 : Alpha, Budget = 15 000€.
*   Fait 2 : Beta, Superviseur = Julie.
*   Fait 3 : Gamma, Statut = Retard de 3 semaines.
 
**Réponses basées uniquement sur ces faits :**
 
#### 1. Quel est le statut du projet de Julie ?
 
D'après le Fait 2 ("Le projet Beta est supervisé par Julie" ), nous savons que **Julie supervise le projet Beta**. Cependant, les faits ne contiennent aucune information concernant l'état d'avancement (statut) de ce projet. Son statut est donc **inconnu** selon les données fournies.
 
#### 2. Quel est le budget total mentionné ?
 
Le seul budget chiffré mentionné dans l'ensemble des trois faits concerne le Projet Alpha. Nous n'avons pas de chiffre global ou "total" pour tous les projets (Alpha, Beta, Gamma). Le budget spécifique mentionné est : **15 000€** (pour le projet Alpha).
 
---
***Synthèse en format Tableau de Bord (Data Analyst View)***:
 
| Indicateur | Projet Concerné | Valeur Extraite | Statut / Remarque | Source du Fait |
| :--- | :--- | :--- | :--- | :--- |
| **Superviseur** | Beta | Julie | Info connue. | Fait 2 |
| **Statut de Beta** | Beta | N/A | **Inconnu**. Manque une donnée. | (N/A) |
| **Budget Total** | Global | 15 000€ | C'est le budget *partiel* d'Alpha. Un total global n'est pas calculable. | Fait 1 |
 

Message cité 1 fois
Message édité par lapin le 30-06-2026 à 15:13:15
n°40883
the_fennec
f3nn3cUs z3rd4
Posté le 30-06-2026 à 17:34:56  profilanswer
 

Bon petit retour de l'ajout de la seconde BC250 en plus de la RXT 4060Ti 16GB.
 
Coté positif: j'ai plein de VRAM, je peux viser 44GB, donc un modèle comme Qwen3.6-35B-A3B-UD-Q8_K_XL_MTP qui fait 38GB avec 256K de contexte en Q8 ça passe.
Coté négatif: j'ai plein de VRAM :o mais pas plus de bande passante. En préfil, je commence a 570 t/s ... mais arrivé a 250k de contexte je tombe a 20 ou 30 tg/s.
 
Coté tg/s ça n'a pas vraiment changé, 10/s pour 27B en MTP dans les 30/50 pour 35B.
 
J'ai mis les ventilos pleine balle, c'est plus stable, activé les 40 cu sur les deux cartes, mais pas de gain. La limite est coté RPC, en tensor split layers tout est séquentiel donc plus on mets des nodes, plus c'est lent. Faudrait pouvoir passer en mode tensor, mais ça marche pas en RPC on dirait. Faudrait aussi pourvoir passer en RDMA, mais c'est une autre histoire :o.
 
Reste une grosse option, c'est de répartir les layers de manière plus intelligente, mais c'est assez compliqué, faudrait que j'arrive a bouger les attentions sur la RTX et laisser les experts sur les BC250, je gagnerais en tg/s mais pas en prefil. J'ai testé mais ça complique grandement la gestion mémoire et j'ai pas réussi a lancer un modèle sans OOM. La seule fois ou ça a marché j'avais des perfs de merde.
 
Je pense que je vais jouer un peu avec Mistral et ensuite remettre 27B en MTP.
 
Sinon je suis passé sur amdgpu_top qui est bien mieux que radeontop ou nvtop:
https://i.imgur.com/aj1Jbki.png


---------------
Faudra que je teste un jour :o
 Page :   1  2  3  4  5  ..  20  21  22  ..  75  76  77  78  79  80

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)