Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
3987 connectés 

 


Quel titre pour notre topic ?


 
27.0 %
 10 votes
1.  Infra IA : aide au choix et troubleshot de LLM Locaux
 
 
8.1 %
 3 votes
2.  Infra IA : le topic qui reveil vos GPUs
 
 
13.5 %
 5 votes
3.  IA Locale : llama.cpp, VLLM, modèles, tuning! For science. You monster.
 
 
10.8 %
 4 votes
4.  IA Locale : dresseurs de vRAM, LLM, CUDA, RocM, MLX Llama.cpp de père en fils
 
 
10.8 %
 4 votes
5.  IA Locale : votre IA selon vos termes ! (sous condition de ressources en vRAM)
 
 
5.4 %
 2 votes
6.  IA Locale : vous aussi venez mesurer votre pouvoir d'achat en HBM / GDDR / LPDDR / DDR / SDRam / EDO ...
 
 
13.5 %
 5 votes
7.  IA Locale : aucun GPU ni LLM n'a été maltraité pour cette inférence
 
 
8.1 %
 3 votes
8.  IA Locale : joignez l'inférence au chauffage de votre domicile !
 
 
2.7 %
    1 vote
9.  IA Locale : la generation generative au bercail
 

Total : 39 votes (2 votes blancs)
Sondage à 8 choix possibles.
Ce sondage est clos, vous ne pouvez plus voter
 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  36  37  38  39  40  41
Page Suivante
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°45838
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 20-08-2026 à 20:41:44  profilanswer
 

Reprise du message précédent :
Bravo pour ta pugnacité et merci pour le petit reportage, c'est ce genre de config de type Frankenstein qui donne envie de se lancer avec ses propres moyens :D


---------------
Victime de girafophobie, mais se soigne.
n°45839
the_fennec
f3nn3cUs z3rd4
Posté le 20-08-2026 à 20:59:05  profilanswer
 

Pipould's a écrit :

J'ai une possibilité de prendre une cmp170hx pour 1650 balles mais je trouve que ça vaut pas le coup vu le risque a lunlock :(


une 8GB -> 64GB  ou 10GB -> 40GB?
 
Elles sont moins chères sur allibaba je pense, mais ça reste dans les 1200, perso je prendrais pas la risque.
 

moyen_moins a écrit :

le Q6 sur le 3.8 27B, c'est limite 32Go pour le contexte.
j'ai pris la version atomicchat (24.15Go) et en q8/q5_1, j'accroche péniblement les 64k de contexte


 
T'es sous Windows ou Linux?


---------------
Faudra que je teste un jour :o
n°45841
the_fennec
f3nn3cUs z3rd4
Posté le 20-08-2026 à 21:13:26  profilanswer
 

epsiloncentaury a écrit :

Petit retour d’expérience sur un montage IA local  improbable.
 
...
Quelque temps plus tard, je suis tombé sur une vidéo d’un gars qui disait réussir à faire tourner Qwen 35B sur une GTX 1060.  :??:  


Je parie que c'est une vidéo de Codacus :D  
 

epsiloncentaury a écrit :


Puisque llama.cpp permettait des réglages beaucoup plus fins, je me suis dit qu’il fallait retenter l’expérience qui avait échoué sous LM Studio. Avec l’aide de l’IA, j’ai compilé une version de llama.cpp avec deux backends différents dans la même build :
 
GTX 1650 4 Go : CUDA
RX 5600 XT 6 Go : Vulkan


 
 
Perso je suis un fainéant, je prends directement les builds Vulkan, même pour ma RTX:
https://github.com/ggml-org/llama.cpp/releases
 
J'ai l'impression que c'est plus stable, mais surtout j'ai plus a m’embêter avec les versions de CUDA.
 

epsiloncentaury a écrit :


Je ne pensais franchement pas arriver à ça avec cette machine quand j’ai commencé.   :D


 
Et bien félicitations :jap: pour quelqu'un qui dit ne pas s'y connaître, c'est un sacré boulot, mais en s'aidant d'une IA!


Message édité par the_fennec le 20-08-2026 à 21:14:01

---------------
Faudra que je teste un jour :o
n°45844
lapin
Posté le 20-08-2026 à 21:17:51  profilanswer
 

De mon coté, ça n'est pas ça:
 

Citation :


<svg width="500" height="500" viewBox="0 0 500 500" xmlns="http://www.w3.org/2000/svg">
  <!-- Fond blanc -->
  <rect width="100%" height="100%" fill="white" />
 
  <!-- Groupes des lignes -->
  <g stroke="black" stroke-width="2" fill="none">
    <!-- Ligne de gauche (A-D-G) -->
    <line x1="100" y1="50" x2="100" y2="450" />
     
    <!-- Ligne de droite (B-C) -->
    <line x1="400" y1="150" x2="400" y2="450" />
     
    <!-- Ligne horizontale supérieure (A-E-B) -->
    <line x1="100" y1="50" x2="400" y2="150" />
     
    <!-- Ligne horizontale médiane (D-H-E) -->
    <line x1="100" y1="250" x2="400" y2="250" />
     
    <!-- Ligne horizontale inférieure (G-F-C) -->
    <line x1="100" y1="450" x2="400" y2="450" />
     
    <!-- Ligne verticale centrale (E-H-F) -->
    <line x1="250" y1="100" x2="250" y2="450" />
     
    <!-- Correction pour correspondre exactement au tracé de l'image -->
    <!-- On redessine les segments pour la structure spécifique de l'image -->
    <line x1="100" y1="50" x2="400" y2="150" /> <!-- AB -->
    <line x1="400" y1="150" x2="400" y2="450" /> <!-- BC -->
    <line x1="400" y1="450" x2="100" y2="450" /> <!-- CG -->
    <line x1="100" y1="450" x2="100" y2="50" />  <!-- DA -->
    <line x1="100" y1="250" x2="400" y2="250" /> <!-- DE -->
    <line x1="250" y1="100" x2="250" y2="450" /> <!-- EF -->
  </g>
 
  <!-- Labels des points -->
  <g font-family="Arial, sans-serif" font-size="18" font-weight="bold">
    <text x="85" y="55">A</text>
    <text x="405" y="155">B</text>
    <text x="405" y="465">C</text>
    <text x="85" y="265">D</text>
    <text x="240" y="100">E</text>
    <text x="240" y="465">F</text>
    <text x="85" y="475">G</text>
    <text x="255" y="265">H</text>
  </g>
</svg>


 
 [:jblover]  [:fez666]  
 

Citation :


<svg width="500" height="500" viewBox="0 0 500 500" xmlns="http://www.w3.org/2000/svg">
  <!-- Fond blanc -->
  <rect width="100%" height="100%" fill="white" />
 
  <!-- Groupes des lignes -->
  <g stroke="black" stroke-width="2" fill="none">
    <!-- Parallélogramme extérieur A-B-C-D -->
    <!-- Segment AB (haut) -->
    <line x1="50" y1="50" x2="450" y2="150" />
    <!-- Segment BC (droite) -->
    <line x1="450" y1="150" x2="450" y2="450" />
    <!-- Segment CD (bas) -->
    <line x1="450" y1="450" x2="50" y2="350" />
    <!-- Segment DA (gauche) -->
    <line x1="50" y1="350" x2="50" y2="50" />
 
    <!-- Ligne médiane D-E-B (en réalité D-E et E-B sur l'image) -->
    <line x1="50" y1="250" x2="450" y2="250" />
 
    <!-- Ligne verticale centrale E-F -->
    <line x1="250" y1="150" x2="250" y2="450" />
 
    <!-- Ligne de base G-F-C -->
    <!-- Segment GF -->
    <line x1="50" y1="450" x2="250" y2="450" />
    <!-- Segment FC (la partie droite de la base) -->
    <line x1="250" y1="450" x2="450" y2="450" />
  </g>
 
  <!-- Labels des points -->
  <g font-family="Arial, sans-serif" font-size="20" font-weight="bold">
    <text x="35" y="45">A</text>
    <text x="460" y="145">B</text>
    <text x="460" y="465">C</text>
    <text x="35" y="365">D</text>
    <text x="40" y="245">G</text>
    <text x="240" y="145">E</text>
    <text x="240" y="465">F</text>
    <text x="260" y="260">H</text>
  </g>
</svg>


 

Citation :


<svg width="500" height="400" viewBox="0 0 500 400" xmlns="http://www.w3.org/2000/svg">
  <!-- Fond blanc -->
  <rect width="100%" height="100%" fill="white"/>
   
  <!-- Groupe des lignes -->
  <g stroke="black" stroke-width="2" fill="none">
    <!-- Parallélogramme ABCD -->
    <!-- A=(100,50), B=(400,100), C=(350,300), D=(50,250) -->
    <line x1="100" y1="50" x2="400" y2="100" /> <!-- AB -->
    <line x1="400" y1="100" x2="350" y2="300" /> <!-- BC -->
    <line x1="350" y1="300" x2="50" y2="250" /> <!-- CD -->
    <line x1="50" y1="250" x2="100" y2="50" /> <!-- DA -->
     
    <!-- Ligne verticale EF -->
    <line x1="200" y1="75" x2="200" y2="275" /> <!-- EF -->
     
    <!-- Ligne horizontale passant par D et C (ou médiane) -->
    <!-- Ajustée pour correspondre à la perspective de l'image -->
    <line x1="50" y1="250" x2="350" y2="250" />  
     
    <!-- Ligne de base prolongée vers G -->
    <line x1="50" y1="250" x2="0" y2="275" /> <!-- Prolongement vers G -->
  </g>
 
  <!-- Groupe des étiquettes (Points) -->
  <g font-family="Arial, sans-serif" font-size="18" font-weight="bold">
    <text x="90" y="45">A</text>
    <text x="405" y="95">B</text>
    <text x="355" y="320">C</text>
    <text x="40" y="265">D</text>
    <text x="195" y="70">E</text>
    <text x="195" y="285">F</text>
    <text x="25" y="260">G</text>
    <text x="205" y="230">H</text>
  </g>
</svg>


 
 
C'est peut-être de l'art, mais le petit google/gemma-4-12b-qat ira quand même en SES au collège l'année prochaine !!!!

n°45847
neo world
Posté le 20-08-2026 à 21:44:59  profilanswer
 

epsiloncentaury a écrit :

Petit retour d’expérience sur un montage IA local  improbable.  


 
 bienvenue et bravo ! [:implosion du tibia]  
 
Les interventions sur ce topic me rappelle l'informatique dans les années 90/début 2000 : ça intéresse beaucoup de monde mais c'est encore vachement artisanal. A la limite entre la centrale nucléaire et la magie noire ( :o ). Ca nous change de l'aseptisé "j'ai branché une prise. Ca marche. Je vais regarder/faire un foot avec les copains maintenant" :o

Message cité 1 fois
Message édité par neo world le 20-08-2026 à 21:45:27
n°45848
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 20-08-2026 à 21:55:10  profilanswer
 

Rendez moi le debut du watercooling avec jacky pc :O
 
Mes radiateurs de clio 2, mes tubes d'aquarium avec la pompe 220v.
Les waterblock grattés contre des bières aux éleves apprentis tourneurs fraiseurs du lycée d'a coté.
Les heures de débat entre high flow et low flow  
 
[:fedefail:4]


---------------
Victime de girafophobie, mais se soigne.
n°45849
lapin
Posté le 20-08-2026 à 21:59:30  profilanswer
 

neo world a écrit :


 
 bienvenue et bravo ! [:implosion du tibia]  
 
Les interventions sur ce topic me rappelle l'informatique dans les années 90/début 2000 : ça intéresse beaucoup de monde mais c'est encore vachement artisanal. A la limite entre la centrale nucléaire et la magie noire ( :o ). Ca nous change de l'aseptisé "j'ai branché une prise. Ca marche. Je vais regarder/faire un foot avec les copains maintenant" :o


 
 
 
En même temps avec des applications en version 0.4.21(Build 2) et moteur Llama.cpp en version V2.28.2, donc tu m'étonnes qu'on en est au tout début des IA sur LLM locaux !!!

n°45850
Big Blue
Live/Psn/Nid legeantbleu
Posté le 20-08-2026 à 22:14:16  profilanswer
 

Tronklou a écrit :

Rendez moi le debut du watercooling avec jacky pc :O
 
Mes radiateurs de clio 2, mes tubes d'aquarium avec la pompe 220v.
Les waterblock grattés contre des bières aux éleves apprentis tourneurs fraiseurs du lycée d'a coté.
Les heures de débat entre high flow et low flow  
 
[:fedefail:4]


Twingo ici :D

n°45851
neo world
Posté le 20-08-2026 à 22:18:59  profilanswer
 

Tout ça pour gagner combien de MHz ? :o

n°45854
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 20-08-2026 à 22:36:06  profilanswer
 

Nous on faisait ça pour la gloire, le sport, le vrai, dans toute sa beautés innocente :O  
Et aussi parce qu’on avait pas un rond :D  
 
De base je voulais juste ne plus mourir avec le bruit de sèche cheveux de mon pc :D


---------------
Victime de girafophobie, mais se soigne.
n°45862
moyen_moin​s
chat réincarné
Posté le 21-08-2026 à 00:09:02  profilanswer
 

the_fennec a écrit :


une 8GB -> 64GB  ou 10GB -> 40GB?

 

Elles sont moins chères sur allibaba je pense, mais ça reste dans les 1200, perso je prendrais pas la risque.

 


 
the_fennec a écrit :

 

T'es sous Windows ou Linux?


Windows win10.
Quand faudra passer sous win11 peut être je lâcherais complètement cet OS pourri.

n°45867
the_fennec
f3nn3cUs z3rd4
Posté le 21-08-2026 à 08:30:54  profilanswer
 

moyen_moins a écrit :


Windows win10.
Quand faudra passer sous win11 peut être je lâcherais complètement cet OS pourri.


 
Fait attention aux apps qui tournent et utilisent le GPU et gaspillent de la VRAM. Sur mon Win Server 2019 j'ai désactivé le hardware rendering de Firefox et viré certaines applis du systray aussi. Tu peux voir quelles applis utilisent de la VRAM avec System Informer par exemple.

Message cité 1 fois
Message édité par the_fennec le 21-08-2026 à 08:31:30

---------------
Faudra que je teste un jour :o
n°45872
Pipould's
Posté le 21-08-2026 à 09:16:17  profilanswer
 

Citation :


C'est peut-être de l'art, mais le petit google/gemma-4-12b-qat ira quand même en SES au collège l'année prochaine !!!!


 
lapin, toujours premier sur les bonnes carottes  :love:

n°45878
moyen_moin​s
chat réincarné
Posté le 21-08-2026 à 10:29:28  profilanswer
 

the_fennec a écrit :

 

Fait attention aux apps qui tournent et utilisent le GPU et gaspillent de la VRAM. Sur mon Win Server 2019 j'ai désactivé le hardware rendering de Firefox et viré certaines applis du systray aussi. Tu peux voir quelles applis utilisent de la VRAM avec System Informer par exemple.


J'ai toujours 2-3Go de pris à rien faire dans le task manager.
Faut que je regarde cette histoire effectivement.
C'est pour ça que j'ai du mal à aller gratter les 30Go sur les 2 cartes :jap:

n°45943
lapin
Posté le 22-08-2026 à 10:27:25  profilanswer
 

Dans LM STUDIO dans Runtime à Engine & Framework, CPU llama.cpp (Windows) CPU-only llama.cpp engin vient de passer en version v2.29.1.
 
Bon c'est du llama.cpp en version CPU-Only donc très très lent, à comparer à Llama.cpp version CUDA ou Vulkan ou ROCm.
 

n°45954
the_fennec
f3nn3cUs z3rd4
Posté le 22-08-2026 à 12:32:49  profilanswer
 

Cette version n'a rien a voir avec la vrai version de llama.cpp qui est actuellement de b10581 en pre-release ou 0.2.0 en release.


---------------
Faudra que je teste un jour :o
n°45955
the_fennec
f3nn3cUs z3rd4
Posté le 22-08-2026 à 12:37:39  profilanswer
 

Infatigable Qwen 3.8 et Claude-code:
https://i.imgur.com/rC1fTuL.png
 
Et j'utilise aussi le template de froggeric:
https://huggingface.co/froggeric/Qw [...] -Templates


---------------
Faudra que je teste un jour :o
n°45961
XaTriX
Posté le 22-08-2026 à 13:39:08  profilanswer
 

et ça vaut quoi face à des models frontiers ?
 
ah aussi pourquoi cc en harness ? :o


---------------
[:dawa]
n°45962
yohaskan
Posté le 22-08-2026 à 13:56:06  profilanswer
 

J'ai fini mon opti. :bounce:  
Et après un test de session de jeu pendant un stream de 2 heures, on peut mesure la latence TTFA (Time to First Audio)
Elle répond en moyenne sous les 4s en conversation simple (Generation LLM+ Generation TTS)
 
Y'a 3 ans elle répondait sur Skyrim en 45 seconde...  
Quasiment un X10... (bon j'étais en VR aussi)  
 

Code :
  1. ## 2. TTFA par type d'outil
  2. ```
  3. ┌──────────────────────────────────────────┬─────┬─────────┬─────────┬────────┬─────────┬─────────┐
  4. │ Type d'échange                           │   n │ moyenne │ médiane │    min │     p90 │     max │
  5. ├──────────────────────────────────────────┼─────┼─────────┼─────────┼────────┼─────────┼─────────┤
  6. │ Global (tous confondus)                  │ 105 │  5,23 s │  4,56 s │ 0,09 s │  8,04 s │ 13,82 s │
  7. │ conversation (discussion simple)         │  41 │  3,42 s │  3,49 s │ 0,09 s │  4,50 s │  5,55 s │
  8. │ search_wiki (recherche wiki)             │  18 │  6,06 s │  5,99 s │ 1,07 s │  9,41 s │ 10,61 s │
  9. │ analyze_screen (regarde l'écran)         │  22 │  7,21 s │  6,69 s │ 5,39 s │  8,50 s │ 13,58 s │
  10. │ analyze_visual_memory (mémoire visuelle) │  13 │  8,26 s │  7,33 s │ 6,32 s │ 11,83 s │ 13,82 s │
  11. │ store_memory                             │   6 │  3,98 s │  3,83 s │ 3,46 s │  4,63 s │  4,71 s │
  12. │ search_memory                            │   1 │  3,67 s │  3,67 s │ 3,67 s │  3,67 s │  3,67 s │
  13. └──────────────────────────────────────────┴─────┴─────────┴─────────┴────────┴─────────┴─────────┘
  14. ```
  15. ## 2bis. Distribution des TTFA (global, n=105)
  16. Chaque ligne = une tranche de durée ; **nb d'échanges** = nombre d'échanges dont le
  17. TTFA tombe dans cette tranche (la barre est proportionnelle à ce nombre).
  18. ```
  19. Tranche distribution                     nb d'échanges
  20. 00-03s  ████████████                              16   ← très réactif
  21. 03-05s  ██████████████████████████████            39   ← le pic : la grande majorité
  22. 05-07s  ████████████████████                      26
  23. 07-09s  █████████████                             17
  24. 09-12s  ███                                        4
  25. 12-15s  ██                                         3
  26. >=15s                                              0
  27. ```


 
L'opti du code a été refaite avec Qwen3.8 27B, et pour la session de stream, j'utilise un gemma 4 12B plus simple (pas besoin de coder) juste d'etre rapide et de choisir le bon outil
 
Un extrait de la consol CHESIREAI 2.0 est ici (le reste, c'est les 2 heures de stream du jeu... c'est secondaire...)
https://youtube.com/shorts/nm1e77ry5nw?feature=share
 
PS: Je rapelle que tout est local sur le même PC

n°45964
Big Blue
Live/Psn/Nid legeantbleu
Posté le 22-08-2026 à 15:58:30  profilanswer
 

neo world a écrit :

Tout ça pour gagner combien de MHz ? :o


Pour le silence, noctua n’existait pas à l’époque :o
 
C’était extrêmement silencieux une fois que le réservoir d’eau au dessus de la carte mère, en plexi fait maison, avait explosé :o


Message édité par Big Blue le 22-08-2026 à 16:01:44
n°45965
Big Blue
Live/Psn/Nid legeantbleu
Posté le 22-08-2026 à 15:59:44  profilanswer
 

Je suis en pleine tentative d’installation de ornith 1.5 A3B, bon pas en Q4 apparemment, peut être en Q2 XS ( en version libre libre :o ).

 

Faut pas que ca fonctionne trop bien, y’a des bc-250 pas trop cher :o


Message édité par Big Blue le 22-08-2026 à 16:02:04
 Page :   1  2  3  4  5  ..  36  37  38  39  40  41
Page Suivante

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)