Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
3580 connectés 

 


Dernière réponse
Sujet : Infra IA : aide au choix et troubleshot de LLM Locaux
neo world Pour ceux qui hésitent à s'équiper parce que "personne n'est assez fou pour ..." On sera toujours le petit joueur de quelqu'un :o
 
https://rehost.diberie.com/Picture/Get/f/538197

Votre réponse
Nom d'utilisateur    Pour poster, vous devez être inscrit sur ce forum .... si ce n'est pas le cas, cliquez ici !
Le ton de votre message                        
                       
Votre réponse


[b][i][u][strike][spoiler][fixed][cpp][url][email][img][*]   
 
   [quote]
 

Options

 
Vous avez perdu votre mot de passe ?


Vue Rapide de la discussion
neo world Pour ceux qui hésitent à s'équiper parce que "personne n'est assez fou pour ..." On sera toujours le petit joueur de quelqu'un :o
 
https://rehost.diberie.com/Picture/Get/f/538197
the_fennec

Tronklou a écrit :

Très content d'open code 2 perso, j'ai tout viré et migré dessus.  
Apres je l'utilise pas en petit model donc pour du local je sais pas du tout


 
 :jap: t'en fais quoi?

the_fennec

totosssfr a écrit :


En parlant de harness, j'ai vu passer Deepseek Harness. Quelqu'un a testé?


 
Pas testé encore, intéressé par des retours :o

totosssfr

the_fennec a écrit :

Infatigable Qwen 3.8 et Claude-code:
https://i.imgur.com/rC1fTuL.png
 
Et j'utilise aussi le template de froggeric:
https://huggingface.co/froggeric/Qw [...] -Templates


Merci pour le template, faut que je teste. :jap:  
 

yohaskan a écrit :

J'ai fini mon opti. :bounce:  
...
 
Un extrait de la consol CHESIREAI 2.0 est ici (le reste, c'est les 2 heures de stream du jeu... c'est secondaire...)
https://youtube.com/shorts/nm1e77ry5nw?feature=share
 
PS: Je rapelle que tout est local sur le même PC


Beau projet !
 
 
De mon coté, je suis passé de llm-scaler-vllm 0.21.b3 (fork vllm maintenu par intel) à vllm-openai-xpu 0.27.1.  
Contrairement à llm-scaler-vllm, vllm-openai-xpu est une version up to date du projet principal.
J'obtiens les mêmes performances sur les deux (20tg/s avec les options les plus efficaces).
 
J'utilise entre autre VLLM_XPU_ENABLE_XPU_GRAPH=1.  
Avec cette option, je passe de 17tg/s à 20tg/s mais ça consomme presque 2 Go de Vram supplémentaire et, actuellement, l'option est incompatible multi GPU.
Je vérifierai ça la semaine prochaine quand la seconde arc B60 sera arrivée.
 
En parlant de harness, j'ai vu passer Deepseek Harness. Quelqu'un a testé?
 
 

Tronklou Très content d'open code 2 perso, j'ai tout viré et migré dessus.  
Apres je l'utilise pas en petit model donc pour du local je sais pas du tout
the_fennec

XaTriX a écrit :

Opencode2 t'as pas test ? :o


Non, c'est prévu, mais pas motivé.
 
Comme derrière ils vendent du Cloud il n'ont aucun intérêt a ce que le local marche bien...
 
J'ai qwen-code dans ma liste aussi.

the_fennec

moyen_moins a écrit :

les modèles récents 12B-14B, à part gemma 4, il y a pas non ?
ça vaut quoi les LFM 2.5 ?


 
Ya Ling tiny 8B A1B, mais c'est plus petit, j'ai pas testé. Je trouve intéressant un MoE aussi petit  [:perco_35:2]

XaTriX Opencode2 t'as pas test ? :o
the_fennec

XaTriX a écrit :

et ça vaut quoi face à des models frontiers ?
 
ah aussi pourquoi cc en harness ? :o


 
Qwen 27B est très fort, mais très lent aussi. Les benchs le donnent au niveau d'Opus 4.6, même si j'ai un peu de mal a y croire. En tout cas il avance bien sur mon projet alacon.
 
Je reviens régulièrement sur CC, car tous les autres finissent par partir en couille sur mes prompts (qui sont longs :o ).
 
Opencode est fini a la pisse et déconne souvent, genre il s'arrête sans raison. Quelques post plus haut j'ai linké un bug, si le modèle contient "qwen" il force le top_p a 1 [:wisi gaud:5]. Je comprends mieux mes boucles, problème de tooling ou les stop...
Pi est trop limité, OK il faut mettre/faire des plugins, mais il devient ensuite trop sensible aux changement de modèles.
Little-coder est trop directif et vibe-codé. Ses interruptions de thinking font plus de mal qu'autre chose. En plus il gère mal le contexte. Je l'ai configuré pour compacter a 80% de 256K, une fois sur deux, llama.cpp l'envoie bouler car il ajoute des trucs pour la compaction et dépasse les 256K alors qu'il lui reste 50K... Je suis obligé de clear le contexte et repartir a zéro.
Codex marchait pas bien avec llama.cpp, il finissait par avoir des erreurs 500 et s'est auto-détruit quand je lui ait dit de régler le problème.
open-claw déconne a plein tube, ne peut pas marcher avec du local, du frontier non plus d'ailleurs.
Hermess bouffe trop de contexte pour sa propre config, il reste rien pour bosser avec sur des trucs sérieux.
 
Il y a trois types de harness:
- ceux qui ne marchent que parce que le modèle derrière est balaise et est capable de tout rattraper (OClaw, Hermes)
- les bouses vibe-codées tout juste bonnes a faire un post Reddit ou une vidéo YT (OCode, Pi, LC)
- ceux ou des gens sont payer pour en faire le dev, comme CC ou codex.

moyen_moins les modèles récents 12B-14B, à part gemma 4, il y a pas non ?
ça vaut quoi les LFM 2.5 ?
Big Blue Je suis en pleine tentative d’installation de ornith 1.5 A3B, bon pas en Q4 apparemment, peut être en Q2 XS ( en version libre libre :o ).

 

Faut pas que ca fonctionne trop bien, y’a des bc-250 pas trop cher :o

Big Blue

neo world a écrit :

Tout ça pour gagner combien de MHz ? :o


Pour le silence, noctua n’existait pas à l’époque :o
 
C’était extrêmement silencieux une fois que le réservoir d’eau au dessus de la carte mère, en plexi fait maison, avait explosé :o

yohaskan J'ai fini mon opti. :bounce:  
Et après un test de session de jeu pendant un stream de 2 heures, on peut mesure la latence TTFA (Time to First Audio)
Elle répond en moyenne sous les 4s en conversation simple (Generation LLM+ Generation TTS)
 
Y'a 3 ans elle répondait sur Skyrim en 45 seconde...  
Quasiment un X10... (bon j'étais en VR aussi)  
 

Code :
  1. ## 2. TTFA par type d'outil
  2. ```
  3. ┌──────────────────────────────────────────┬─────┬─────────┬─────────┬────────┬─────────┬─────────┐
  4. │ Type d'échange                           │   n │ moyenne │ médiane │    min │     p90 │     max │
  5. ├──────────────────────────────────────────┼─────┼─────────┼─────────┼────────┼─────────┼─────────┤
  6. │ Global (tous confondus)                  │ 105 │  5,23 s │  4,56 s │ 0,09 s │  8,04 s │ 13,82 s │
  7. │ conversation (discussion simple)         │  41 │  3,42 s │  3,49 s │ 0,09 s │  4,50 s │  5,55 s │
  8. │ search_wiki (recherche wiki)             │  18 │  6,06 s │  5,99 s │ 1,07 s │  9,41 s │ 10,61 s │
  9. │ analyze_screen (regarde l'écran)         │  22 │  7,21 s │  6,69 s │ 5,39 s │  8,50 s │ 13,58 s │
  10. │ analyze_visual_memory (mémoire visuelle) │  13 │  8,26 s │  7,33 s │ 6,32 s │ 11,83 s │ 13,82 s │
  11. │ store_memory                             │   6 │  3,98 s │  3,83 s │ 3,46 s │  4,63 s │  4,71 s │
  12. │ search_memory                            │   1 │  3,67 s │  3,67 s │ 3,67 s │  3,67 s │  3,67 s │
  13. └──────────────────────────────────────────┴─────┴─────────┴─────────┴────────┴─────────┴─────────┘
  14. ```
  15. ## 2bis. Distribution des TTFA (global, n=105)
  16. Chaque ligne = une tranche de durée ; **nb d'échanges** = nombre d'échanges dont le
  17. TTFA tombe dans cette tranche (la barre est proportionnelle à ce nombre).
  18. ```
  19. Tranche distribution                     nb d'échanges
  20. 00-03s  ████████████                              16   ← très réactif
  21. 03-05s  ██████████████████████████████            39   ← le pic : la grande majorité
  22. 05-07s  ████████████████████                      26
  23. 07-09s  █████████████                             17
  24. 09-12s  ███                                        4
  25. 12-15s  ██                                         3
  26. >=15s                                              0
  27. ```


 
L'opti du code a été refaite avec Qwen3.8 27B, et pour la session de stream, j'utilise un gemma 4 12B plus simple (pas besoin de coder) juste d'etre rapide et de choisir le bon outil
 
Un extrait de la consol CHESIREAI 2.0 est ici (le reste, c'est les 2 heures de stream du jeu... c'est secondaire...)
https://youtube.com/shorts/nm1e77ry5nw?feature=share
 
PS: Je rapelle que tout est local sur le même PC

XaTriX et ça vaut quoi face à des models frontiers ?
 
ah aussi pourquoi cc en harness ? :o
the_fennec Infatigable Qwen 3.8 et Claude-code:
https://i.imgur.com/rC1fTuL.png  
 
Et j'utilise aussi le template de froggeric:
https://huggingface.co/froggeric/Qw [...] -Templates
the_fennec Cette version n'a rien a voir avec la vrai version de llama.cpp qui est actuellement de b10581 en pre-release ou 0.2.0 en release.
lapin Dans LM STUDIO dans Runtime à Engine & Framework, CPU llama.cpp (Windows) CPU-only llama.cpp engin vient de passer en version v2.29.1.
 
Bon c'est du llama.cpp en version CPU-Only donc très très lent, à comparer à Llama.cpp version CUDA ou Vulkan ou ROCm.
 
moyen_moins

the_fennec a écrit :

 

Fait attention aux apps qui tournent et utilisent le GPU et gaspillent de la VRAM. Sur mon Win Server 2019 j'ai désactivé le hardware rendering de Firefox et viré certaines applis du systray aussi. Tu peux voir quelles applis utilisent de la VRAM avec System Informer par exemple.


J'ai toujours 2-3Go de pris à rien faire dans le task manager.
Faut que je regarde cette histoire effectivement.
C'est pour ça que j'ai du mal à aller gratter les 30Go sur les 2 cartes :jap:

Pipould's

Citation :


C'est peut-être de l'art, mais le petit google/gemma-4-12b-qat ira quand même en SES au collège l'année prochaine !!!!


 
lapin, toujours premier sur les bonnes carottes  :love:

the_fennec

moyen_moins a écrit :


Windows win10.
Quand faudra passer sous win11 peut être je lâcherais complètement cet OS pourri.


 
Fait attention aux apps qui tournent et utilisent le GPU et gaspillent de la VRAM. Sur mon Win Server 2019 j'ai désactivé le hardware rendering de Firefox et viré certaines applis du systray aussi. Tu peux voir quelles applis utilisent de la VRAM avec System Informer par exemple.

moyen_moins

the_fennec a écrit :


une 8GB -> 64GB  ou 10GB -> 40GB?

 

Elles sont moins chères sur allibaba je pense, mais ça reste dans les 1200, perso je prendrais pas la risque.

 


 
the_fennec a écrit :

 

T'es sous Windows ou Linux?


Windows win10.
Quand faudra passer sous win11 peut être je lâcherais complètement cet OS pourri.

Tronklou Nous on faisait ça pour la gloire, le sport, le vrai, dans toute sa beautés innocente :O  
Et aussi parce qu’on avait pas un rond :D  
 
De base je voulais juste ne plus mourir avec le bruit de sèche cheveux de mon pc :D
neo world Tout ça pour gagner combien de MHz ? :o
Big Blue

Tronklou a écrit :

Rendez moi le debut du watercooling avec jacky pc :O
 
Mes radiateurs de clio 2, mes tubes d'aquarium avec la pompe 220v.
Les waterblock grattés contre des bières aux éleves apprentis tourneurs fraiseurs du lycée d'a coté.
Les heures de débat entre high flow et low flow  
 
[:fedefail:4]


Twingo ici :D

lapin

neo world a écrit :


 
 bienvenue et bravo ! [:implosion du tibia]  
 
Les interventions sur ce topic me rappelle l'informatique dans les années 90/début 2000 : ça intéresse beaucoup de monde mais c'est encore vachement artisanal. A la limite entre la centrale nucléaire et la magie noire ( :o ). Ca nous change de l'aseptisé "j'ai branché une prise. Ca marche. Je vais regarder/faire un foot avec les copains maintenant" :o


 
 
 
En même temps avec des applications en version 0.4.21(Build 2) et moteur Llama.cpp en version V2.28.2, donc tu m'étonnes qu'on en est au tout début des IA sur LLM locaux !!!

Tronklou Rendez moi le debut du watercooling avec jacky pc :O
 
Mes radiateurs de clio 2, mes tubes d'aquarium avec la pompe 220v.
Les waterblock grattés contre des bières aux éleves apprentis tourneurs fraiseurs du lycée d'a coté.
Les heures de débat entre high flow et low flow  
 
[:fedefail:4]
neo world

epsiloncentaury a écrit :

Petit retour d’expérience sur un montage IA local  improbable.  


 
 bienvenue et bravo ! [:implosion du tibia]  
 
Les interventions sur ce topic me rappelle l'informatique dans les années 90/début 2000 : ça intéresse beaucoup de monde mais c'est encore vachement artisanal. A la limite entre la centrale nucléaire et la magie noire ( :o ). Ca nous change de l'aseptisé "j'ai branché une prise. Ca marche. Je vais regarder/faire un foot avec les copains maintenant" :o

lapin De mon coté, ça n'est pas ça:
 

Citation :


<svg width="500" height="500" viewBox="0 0 500 500" xmlns="http://www.w3.org/2000/svg">
  <!-- Fond blanc -->
  <rect width="100%" height="100%" fill="white" />
 
  <!-- Groupes des lignes -->
  <g stroke="black" stroke-width="2" fill="none">
    <!-- Ligne de gauche (A-D-G) -->
    <line x1="100" y1="50" x2="100" y2="450" />
     
    <!-- Ligne de droite (B-C) -->
    <line x1="400" y1="150" x2="400" y2="450" />
     
    <!-- Ligne horizontale supérieure (A-E-B) -->
    <line x1="100" y1="50" x2="400" y2="150" />
     
    <!-- Ligne horizontale médiane (D-H-E) -->
    <line x1="100" y1="250" x2="400" y2="250" />
     
    <!-- Ligne horizontale inférieure (G-F-C) -->
    <line x1="100" y1="450" x2="400" y2="450" />
     
    <!-- Ligne verticale centrale (E-H-F) -->
    <line x1="250" y1="100" x2="250" y2="450" />
     
    <!-- Correction pour correspondre exactement au tracé de l'image -->
    <!-- On redessine les segments pour la structure spécifique de l'image -->
    <line x1="100" y1="50" x2="400" y2="150" /> <!-- AB -->
    <line x1="400" y1="150" x2="400" y2="450" /> <!-- BC -->
    <line x1="400" y1="450" x2="100" y2="450" /> <!-- CG -->
    <line x1="100" y1="450" x2="100" y2="50" />  <!-- DA -->
    <line x1="100" y1="250" x2="400" y2="250" /> <!-- DE -->
    <line x1="250" y1="100" x2="250" y2="450" /> <!-- EF -->
  </g>
 
  <!-- Labels des points -->
  <g font-family="Arial, sans-serif" font-size="18" font-weight="bold">
    <text x="85" y="55">A</text>
    <text x="405" y="155">B</text>
    <text x="405" y="465">C</text>
    <text x="85" y="265">D</text>
    <text x="240" y="100">E</text>
    <text x="240" y="465">F</text>
    <text x="85" y="475">G</text>
    <text x="255" y="265">H</text>
  </g>
</svg>


 
 [:jblover]  [:fez666]  
 

Citation :


<svg width="500" height="500" viewBox="0 0 500 500" xmlns="http://www.w3.org/2000/svg">
  <!-- Fond blanc -->
  <rect width="100%" height="100%" fill="white" />
 
  <!-- Groupes des lignes -->
  <g stroke="black" stroke-width="2" fill="none">
    <!-- Parallélogramme extérieur A-B-C-D -->
    <!-- Segment AB (haut) -->
    <line x1="50" y1="50" x2="450" y2="150" />
    <!-- Segment BC (droite) -->
    <line x1="450" y1="150" x2="450" y2="450" />
    <!-- Segment CD (bas) -->
    <line x1="450" y1="450" x2="50" y2="350" />
    <!-- Segment DA (gauche) -->
    <line x1="50" y1="350" x2="50" y2="50" />
 
    <!-- Ligne médiane D-E-B (en réalité D-E et E-B sur l'image) -->
    <line x1="50" y1="250" x2="450" y2="250" />
 
    <!-- Ligne verticale centrale E-F -->
    <line x1="250" y1="150" x2="250" y2="450" />
 
    <!-- Ligne de base G-F-C -->
    <!-- Segment GF -->
    <line x1="50" y1="450" x2="250" y2="450" />
    <!-- Segment FC (la partie droite de la base) -->
    <line x1="250" y1="450" x2="450" y2="450" />
  </g>
 
  <!-- Labels des points -->
  <g font-family="Arial, sans-serif" font-size="20" font-weight="bold">
    <text x="35" y="45">A</text>
    <text x="460" y="145">B</text>
    <text x="460" y="465">C</text>
    <text x="35" y="365">D</text>
    <text x="40" y="245">G</text>
    <text x="240" y="145">E</text>
    <text x="240" y="465">F</text>
    <text x="260" y="260">H</text>
  </g>
</svg>


 

Citation :


<svg width="500" height="400" viewBox="0 0 500 400" xmlns="http://www.w3.org/2000/svg">
  <!-- Fond blanc -->
  <rect width="100%" height="100%" fill="white"/>
   
  <!-- Groupe des lignes -->
  <g stroke="black" stroke-width="2" fill="none">
    <!-- Parallélogramme ABCD -->
    <!-- A=(100,50), B=(400,100), C=(350,300), D=(50,250) -->
    <line x1="100" y1="50" x2="400" y2="100" /> <!-- AB -->
    <line x1="400" y1="100" x2="350" y2="300" /> <!-- BC -->
    <line x1="350" y1="300" x2="50" y2="250" /> <!-- CD -->
    <line x1="50" y1="250" x2="100" y2="50" /> <!-- DA -->
     
    <!-- Ligne verticale EF -->
    <line x1="200" y1="75" x2="200" y2="275" /> <!-- EF -->
     
    <!-- Ligne horizontale passant par D et C (ou médiane) -->
    <!-- Ajustée pour correspondre à la perspective de l'image -->
    <line x1="50" y1="250" x2="350" y2="250" />  
     
    <!-- Ligne de base prolongée vers G -->
    <line x1="50" y1="250" x2="0" y2="275" /> <!-- Prolongement vers G -->
  </g>
 
  <!-- Groupe des étiquettes (Points) -->
  <g font-family="Arial, sans-serif" font-size="18" font-weight="bold">
    <text x="90" y="45">A</text>
    <text x="405" y="95">B</text>
    <text x="355" y="320">C</text>
    <text x="40" y="265">D</text>
    <text x="195" y="70">E</text>
    <text x="195" y="285">F</text>
    <text x="25" y="260">G</text>
    <text x="205" y="230">H</text>
  </g>
</svg>


 
 
C'est peut-être de l'art, mais le petit google/gemma-4-12b-qat ira quand même en SES au collège l'année prochaine !!!!

the_fennec

epsiloncentaury a écrit :

Petit retour d’expérience sur un montage IA local  improbable.
 
...
Quelque temps plus tard, je suis tombé sur une vidéo d’un gars qui disait réussir à faire tourner Qwen 35B sur une GTX 1060.  :??:  


Je parie que c'est une vidéo de Codacus :D  
 

epsiloncentaury a écrit :


Puisque llama.cpp permettait des réglages beaucoup plus fins, je me suis dit qu’il fallait retenter l’expérience qui avait échoué sous LM Studio. Avec l’aide de l’IA, j’ai compilé une version de llama.cpp avec deux backends différents dans la même build :
 
GTX 1650 4 Go : CUDA
RX 5600 XT 6 Go : Vulkan


 
 
Perso je suis un fainéant, je prends directement les builds Vulkan, même pour ma RTX:
https://github.com/ggml-org/llama.cpp/releases
 
J'ai l'impression que c'est plus stable, mais surtout j'ai plus a m’embêter avec les versions de CUDA.
 

epsiloncentaury a écrit :


Je ne pensais franchement pas arriver à ça avec cette machine quand j’ai commencé.   :D


 
Et bien félicitations :jap: pour quelqu'un qui dit ne pas s'y connaître, c'est un sacré boulot, mais en s'aidant d'une IA!

the_fennec

Pipould's a écrit :

J'ai une possibilité de prendre une cmp170hx pour 1650 balles mais je trouve que ça vaut pas le coup vu le risque a lunlock :(


une 8GB -> 64GB  ou 10GB -> 40GB?
 
Elles sont moins chères sur allibaba je pense, mais ça reste dans les 1200, perso je prendrais pas la risque.
 

moyen_moins a écrit :

le Q6 sur le 3.8 27B, c'est limite 32Go pour le contexte.
j'ai pris la version atomicchat (24.15Go) et en q8/q5_1, j'accroche péniblement les 64k de contexte


 
T'es sous Windows ou Linux?

Tronklou Bravo pour ta pugnacité et merci pour le petit reportage, c'est ce genre de config de type Frankenstein qui donne envie de se lancer avec ses propres moyens :D

Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)