| |||||
| Dernière réponse | ||
|---|---|---|
| Sujet : Infra IA : aide au choix et troubleshot de LLM Locaux | ||
| neo world |
|
|
| Aperçu |
|---|
| Vue Rapide de la discussion |
|---|
| neo world |
|
| tfpsly |
|
| Pipould's |
|
| Pipould's |
|
| neo world | Moi je suis passé en mode [:sire de botcor:1] :
=> augmentation du sustained maxpower du GPU (+15% environ @110w en sustained. J'ai encore de la place vs les 120w max d'AMD). Ca consomme 1w de plus en idle [:roger21:1] => limite à 95°c au cas où. Le GPU passe de 80% max avant l'overclocking à 93° max. Ça passe [:fairyfeller:1] => augmentation de la consommation du package d'environ de +15% en PP et 1 à 2% en TG [:taraj:8] => augmentation de la fréquence GPU @ 2750mhz en moyenne vs 2500Mhz en moyenne sur le PP et carrément 2900Mhz pendant la generation de jetons (mais en se tournant les pouces à 80% quoi) [:aka44] Bon 16% de performance en plus sur le PP et quand même +2,9% de gain de perf en TG/s. Pas trouvé de point d'entrée pour pousser un peu la BP RAM (c'est elle qui bloque surtout le TG). Je prend quand même :D J'ai trouvé le fork compatible Strix halo ici (auttention faudra les kernel / dkms headers pour que ça compile) : git clone -b dev https://github.com/CkNoSFeRaTU/ryzen_smu.git ryzen_smu_fork et j'ai utilisé ces paramètres : sudo ~/RyzenAdj/build/ryzenadj \ --stapm-limit=110000 \ --fast-limit=130000 \ --slow-limit=110000 \ --apu-slow-limit=90000 \ --tctl-temp=95 explication des settings par claude : https://rehost.diberie.com/Picture/Get/f/543226 ca va rester en l'état comme j'ai pas trouvé grand chose pour la mémoire mais je prend les quelques pourcents grappillés :jap: Et j'ai appris pourquoi des fois pi démarrait quasi instantanément la TG après une compaction : le KV cache ça marche :D et sinon prochaine étape je test le https://github.com/halo-box/strix-llama.cpp.git voir ce ue je peux en tirer vs mon llama qui venait d'atomic chat |
| speedboyz30 |
|
| Pipould's |
J'utilise depuis 2 jours. Pour moi ça rend le Strix a peut près utilisable... |
| moyen_moins | des testeurs d'halogen pour les strix halo ? sur qwen 3.8 flash next, ça a l'air de bien améliorer le pp te le pg [:paysan] |
| Tronklou | C'est tellement efficace et génial que le produit est mort :D Je parie qu'on vas avoir directement les cores spécialisés propre a chaque constructeur dans leurs apu et/igpu, tout simplement. Ca consommera pas grand chose non plus, ce sera super standard et logiciellement simple à exploiter. |
| neo world |
|
| Tronklou | La force de la standardisation soft/hardware, clairement.
Mais c'est bien les seuls à pouvoir intégrer du NPU efficacement de par cette verticalité. Sur pc vouloir pousser du NPU revient à ajouter un bloc séparé, avec encore une surcouche à gérer côté soft et hard, un bordel sans nom. :O À côté de ça, les gros du GPU intègrent directement des Tensor Cores / Matrix Cores / XMX => c'est ça la voie à suivre. Personne va s'emmerder à optimiser pour un NPU anémique et spécifique à chaque plateforme versus utiliser des outils déjà intégrés et standardisés. |
| neo world | l'intégration verticale jusqu'à ce niveau de détail fait toute la différence pour Apple.
C'est bordélique côté PC en comparaison mais au moins tu peux installer linux, BSD ou autre sans pleurer le manque absolut de drivers :o l'IGPU sans NPu bouffe beaucoup plus à performance identique en comparaison et pareil pour le CPU. Ca marche mais c'est tout sauf non douloureux pour la batterie et l'enveloppe thermique en général de détourner un accelerateurs sans registres spécialisés. Le LLM ressemble vraiment à du bruteforce si tu regardes un peu comment ça se comporte avec le matos en dessous |
| Tronklou | A ce compte là ton igpu ou cpu fera déjà le taff :sweat: Ceux a suivre pour la voie NPU ce serais apple : ils ont intégrés les npu directement dans les cores gpu, ce qui est la voie la plus logique je dirais. |
| neo world | faut voir si l'agentique "locale" decolle avec des petites optimisations genre commander ton billet d'avion ou mettre un rdv à ta place. Si c'est pas le cas ce ne sera que du marketing.
Ne pas oublier que le NPU consomme moins aussi que le CPU où ça va devoir taper dans des fonctions comme l'AVX pour sortir quelque chose à une vitesse potable. |
| Tronklou |
|
| tfpsly | Le pire avec les NPUs est surtout leur fragmentation. Même pour les Qualcomm, il faut faire un modèle par génération pour les utiliser au mieux. Seules les grosses boîtes peuvent se permettre d'optimiser un kernel par SoC, même sur téléphone. |
| neo world | bah ça coute pas non plus des fortunes d'en graver un bout sur le CPU "au cas où" et ça évite d'acheter un dell avec un core I5 dernière génération mais une 1650 parce que y'en avait qui trainait dans le stock et s'étonner que cortana mets 10 minutes à lui dire quel temps il fera demain ensuite :o |
| Tronklou |
|
| neo world | en plus rien interdit d'installer llamacpp et faire tourner des modèles sur windows. Y'avait un bon exemple avec yohaskan et ses modèles qui récupèrent des infos sur l’environnement dans ses jeux vidéos pour le guider |
| moyen_moins |
|
| speedboyz30 |
|




