Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
4050 connectés 

 


Dernière réponse
Sujet : Infra IA : aide au choix et troubleshot de LLM Locaux
neo world

Pipould's a écrit :


 
Mets ton CO a -35 et installes halogen  :jap:  


sur le principe ça a l'air pas mal mais je bosse avec un context à 200k et ça semble lui poser problème en terme de perfs ( https://sleepingrobots.com/dreams/h [...] trix-halo/ )
je vais déjà faire un peu de llama strix. Je viendrai quand ce sera plus clair quelle magie noire opère pour halogen :jap:
 
 


Votre réponse
Nom d'utilisateur    Pour poster, vous devez être inscrit sur ce forum .... si ce n'est pas le cas, cliquez ici !
Le ton de votre message                        
                       
Votre réponse


[b][i][u][strike][spoiler][fixed][cpp][url][email][img][*]   
 
   [quote]
 

Options

 
Vous avez perdu votre mot de passe ?


Vue Rapide de la discussion
neo world

Pipould's a écrit :


 
Mets ton CO a -35 et installes halogen  :jap:  


sur le principe ça a l'air pas mal mais je bosse avec un context à 200k et ça semble lui poser problème en terme de perfs ( https://sleepingrobots.com/dreams/h [...] trix-halo/ )
je vais déjà faire un peu de llama strix. Je viendrai quand ce sera plus clair quelle magie noire opère pour halogen :jap:
 
 

tfpsly

neo world a écrit :


attends que ça se stabilise. Personne ne savait quoi faire du TPU de google avant que tf light facilite la détection d'objets à 100 fps pour moins de 5w :D
 
d'ailleurs on attend toujours un successeur autre part que sur le pixel :/


Ah mais si, Google fait pleins de choses géniales avec ses TPUs! Tous leurs trucs d'AI, effets caméra et Zoom 120x sont sur TPU. Bon, c'est surtout parce que ça pourrait tourner sur GPU, mais que celui qu'ils ont choisi rame à mort... Mais c'est bien le TPU (quand on choisit un GPU moisi).

Pipould's

speedboyz30 a écrit :


 
Intéressant, ça donne quoi concrètement ?


 
Ca donne que demain tout le monde te dira d'aller dessus.
 
Au debut les gens etaient dans le denial, la les maintainers de lemonade en parlent et donato aussi (celui qui fait les toolbox pour le strix).
 
Perso ca bosse, ca ne part pas en timeout, il faut que je check la semaine prochaine sur des projets pro.

Pipould's

neo world a écrit :

Moi je suis passé en mode  [:sire de botcor:1]  :
=> augmentation du sustained maxpower du GPU (+15% environ @110w en sustained. J'ai encore de la place vs les 120w max d'AMD). Ca consomme 1w de plus en idle [:roger21:1]  
=> limite à 95°c au cas où. Le GPU passe de 80% max avant l'overclocking à 93° max. Ça passe  [:fairyfeller:1]  
=> augmentation de la consommation du package d'environ de +15% en PP et 1 à 2% en TG  [:taraj:8]  
=> augmentation de la fréquence GPU @ 2750mhz en moyenne vs 2500Mhz en moyenne sur le PP et carrément 2900Mhz pendant la generation de jetons (mais en se tournant les pouces à 80% quoi) [:aka44]  
 
Bon 16% de performance en plus sur le PP et quand même +2,9% de gain de perf en TG/s. Pas trouvé de point d'entrée pour pousser un peu la BP RAM (c'est elle qui bloque surtout le TG). Je prend quand même :D
 
J'ai trouvé le fork compatible Strix halo ici (auttention faudra les kernel / dkms headers pour que ça compile) :
git clone -b dev https://github.com/CkNoSFeRaTU/ryzen_smu.git ryzen_smu_fork
 
et j'ai utilisé ces paramètres :
sudo ~/RyzenAdj/build/ryzenadj \
  --stapm-limit=110000 \
  --fast-limit=130000 \
  --slow-limit=110000 \
  --apu-slow-limit=90000 \
  --tctl-temp=95
 
explication des settings par claude :
https://rehost.diberie.com/Picture/Get/f/543226
 
ca va rester en l'état comme j'ai pas trouvé grand chose pour la mémoire mais je prend les quelques pourcents grappillés  :jap:  
 
Et j'ai appris pourquoi des fois pi démarrait quasi instantanément la TG après une compaction : le KV cache ça marche  :D  
 
et sinon prochaine étape je test le https://github.com/halo-box/strix-llama.cpp.git voir ce ue je peux en tirer vs mon llama qui venait d'atomic chat


 
Mets ton CO a -35 et installes halogen  :jap:  

neo world Moi je suis passé en mode  [:sire de botcor:1]  :
=> augmentation du sustained maxpower du GPU (+15% environ @110w en sustained. J'ai encore de la place vs les 120w max d'AMD). Ca consomme 1w de plus en idle [:roger21:1]  
=> limite à 95°c au cas où. Le GPU passe de 80% max avant l'overclocking à 93° max. Ça passe  [:fairyfeller:1]  
=> augmentation de la consommation du package d'environ de +15% en PP et 1 à 2% en TG  [:taraj:8]  
=> augmentation de la fréquence GPU @ 2750mhz en moyenne vs 2500Mhz en moyenne sur le PP et carrément 2900Mhz pendant la generation de jetons (mais en se tournant les pouces à 80% quoi) [:aka44]  
 
Bon 16% de performance en plus sur le PP et quand même +2,9% de gain de perf en TG/s. Pas trouvé de point d'entrée pour pousser un peu la BP RAM (c'est elle qui bloque surtout le TG). Je prend quand même :D
 
J'ai trouvé le fork compatible Strix halo ici (auttention faudra les kernel / dkms headers pour que ça compile) :
git clone -b dev https://github.com/CkNoSFeRaTU/ryzen_smu.git ryzen_smu_fork
 
et j'ai utilisé ces paramètres :
sudo ~/RyzenAdj/build/ryzenadj \
  --stapm-limit=110000 \
  --fast-limit=130000 \
  --slow-limit=110000 \
  --apu-slow-limit=90000 \
  --tctl-temp=95
 
explication des settings par claude :
https://rehost.diberie.com/Picture/Get/f/543226  
 
ca va rester en l'état comme j'ai pas trouvé grand chose pour la mémoire mais je prend les quelques pourcents grappillés  :jap:  
 
Et j'ai appris pourquoi des fois pi démarrait quasi instantanément la TG après une compaction : le KV cache ça marche  :D  
 
et sinon prochaine étape je test le https://github.com/halo-box/strix-llama.cpp.git voir ce ue je peux en tirer vs mon llama qui venait d'atomic chat
speedboyz30

Pipould's a écrit :


 
J'utilise depuis 2 jours. Pour moi ça rend le Strix a peut près utilisable...


 
Intéressant, ça donne quoi concrètement ?

Pipould's

moyen_moins a écrit :

des testeurs d'halogen pour les strix halo ? sur qwen 3.8 flash next, ça a l'air de bien améliorer le pp te le pg [:paysan]

 

J'utilise depuis 2 jours. Pour moi ça rend le Strix a peut près utilisable...

moyen_moins des testeurs d'halogen pour les strix halo ? sur qwen 3.8 flash next, ça a l'air de bien améliorer le pp te le pg [:paysan]
Tronklou C'est tellement efficace et génial que le produit est mort :D  
 
Je parie qu'on vas avoir directement les cores spécialisés propre a chaque constructeur dans leurs apu et/igpu, tout simplement. Ca consommera pas grand chose non plus, ce sera super standard et logiciellement simple à exploiter.
neo world

Tronklou a écrit :

La force de la standardisation soft/hardware, clairement.
 
Mais c'est bien les seuls à pouvoir intégrer du NPU efficacement de par cette verticalité.
 
Sur pc vouloir pousser du NPU revient à ajouter un bloc séparé, avec encore une surcouche à gérer côté soft et hard, un bordel sans nom. :O
 
À côté de ça, les gros du GPU intègrent directement des Tensor Cores / Matrix Cores / XMX => c'est ça la voie à suivre.
 
Personne va s'emmerder à optimiser pour un NPU anémique et spécifique à chaque plateforme versus utiliser des outils déjà intégrés et standardisés.


attends que ça se stabilise. Personne ne savait quoi faire du TPU de google avant que tf light facilite la détection d'objets à 100 fps pour moins de 5w :D
 
d'ailleurs on attend toujours un successeur autre part que sur le pixel :/

Tronklou La force de la standardisation soft/hardware, clairement.
 
Mais c'est bien les seuls à pouvoir intégrer du NPU efficacement de par cette verticalité.
 
Sur pc vouloir pousser du NPU revient à ajouter un bloc séparé, avec encore une surcouche à gérer côté soft et hard, un bordel sans nom. :O
 
À côté de ça, les gros du GPU intègrent directement des Tensor Cores / Matrix Cores / XMX => c'est ça la voie à suivre.
 
Personne va s'emmerder à optimiser pour un NPU anémique et spécifique à chaque plateforme versus utiliser des outils déjà intégrés et standardisés.
neo world l'intégration verticale jusqu'à ce niveau de détail fait toute la différence pour Apple.
 
C'est bordélique côté PC en comparaison mais au moins tu peux installer linux, BSD ou autre sans pleurer le manque absolut de drivers :o
 
l'IGPU sans NPu bouffe beaucoup plus à performance identique en comparaison et pareil pour le CPU. Ca marche mais c'est tout sauf non douloureux pour la batterie et l'enveloppe thermique en général de détourner un accelerateurs sans registres spécialisés. Le LLM ressemble vraiment à du bruteforce si tu regardes un peu comment ça se comporte avec le matos en dessous
Tronklou A ce compte là ton igpu ou cpu fera déjà le taff  :sweat:  
 
Ceux a suivre pour la voie NPU ce serais apple : ils ont intégrés les npu directement dans les cores gpu, ce qui est la voie la plus logique je dirais.
neo world faut voir si l'agentique "locale" decolle avec des petites optimisations genre commander ton billet d'avion ou mettre un rdv à ta place. Si c'est pas le cas ce ne sera que du marketing.
 
Ne pas oublier que le NPU consomme moins aussi que le CPU où ça va devoir taper dans des fonctions comme l'AVX pour sortir quelque chose à une vitesse potable.
Tronklou

neo world a écrit :

bah ça coute pas non plus des fortunes d'en graver un bout sur le CPU "au cas où" et ça évite d'acheter un dell avec un core I5 dernière génération mais une 1650 parce que y'en avait qui trainait dans le stock et s'étonner que cortana mets 10 minutes à lui dire quel temps il fera demain ensuite :o


 
Le seul vrai intérêt du NPU, c’est son rendement. Sur de l’embarqué ok, mais sur un PC portable ou desktop tu as déjà un igpu bien plus polyvalent et infiniment plus simple à exploiter avec des environnements de dev standards.  
Aller optimiser un modèle spécifiquement pour le NPU, c’est souvent se taper une quantité de boulot monstrueuse pour finir avec un truc assez anémique. La consolation, c’est qu’il aura consommé 3 W au lieu de 15 :O
 
Et en plus l’essentiel des petits modèles qui rentrent bien dans le cadre d’un NPU sont tellement petits qu’ils tournent déjà très correctement sur le CPU :O  
Donc tu te tapes un environnement spécifique, de la quantif, des opérateurs pas supportés et potentiellement une optimisation par génération de puce, tout ça pour accélérer un truc qui tournait déjà convenablement sur le CPU.  
 
Tout ca pour ca... Je préfère encore qu’on me mette le budget silicium dans l’igpu ou la bd mémoire.
 
Pour moi c'est juste du marketing et de la segmentation artificielle avec le copilot ready :D

tfpsly Le pire avec les NPUs est surtout leur fragmentation. Même pour les Qualcomm, il faut faire un modèle par génération pour les utiliser au mieux. Seules les grosses boîtes peuvent se permettre d'optimiser un kernel par SoC, même sur téléphone.
neo world bah ça coute pas non plus des fortunes d'en graver un bout sur le CPU "au cas où" et ça évite d'acheter un dell avec un core I5 dernière génération mais une 1650 parce que y'en avait qui trainait dans le stock et s'étonner que cortana mets 10 minutes à lui dire quel temps il fera demain ensuite :o
Tronklou

SynE a écrit :

Rien ne l'utilise au final, microsoft avaient des idées mais ils n'ont rien fait.
 
Et les éditeurs tiers encore moins, c'est anecdotique et il vaut mieux se baser sur le gpu pour toucher plus de monde.


 
C'est fou car les petits NPU en embarqués c'est vraiment une pile intéressante ( en vidéo notamment ), mais clairement quand tu vois toutes les contraintes aussi bien dev que en intégrations hardware... Ca n'a rien a foutre sur un pc desktop :D

neo world en plus rien interdit d'installer llamacpp et faire tourner des modèles sur windows. Y'avait un bon exemple avec yohaskan et ses modèles qui récupèrent des infos sur l’environnement dans ses jeux vidéos pour le guider
moyen_moins

speedboyz30 a écrit :


 
On parlait de windows ? J'ai pas vu.
Je pensais qu'on parlait NPU au sens large, notamment avec l'exemple strix halo + GPU via oculink.


C'est vendredi :o

speedboyz30

moyen_moins a écrit :


Sur windows ? oui :)


 
On parlait de windows ? J'ai pas vu.
Je pensais qu'on parlait NPU au sens large, notamment avec l'exemple strix halo + GPU via oculink.


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)