Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
1902 connectés 

 


Je génère ...
Sondage à 3 choix possibles.
Ce sondage expirera le 20-09-2026 à 10:00




Attention si vous cliquez sur "voir les résultats" vous ne pourrez plus voter

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  56  57  58  59  60  61
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°47642
SynE
Agri du dessert
Posté le 04-09-2026 à 15:02:16  profilanswer
 

Reprise du message précédent :
Carrément mieux :o

n°47643
M300A
Posté le 04-09-2026 à 15:04:25  profilanswer
 

Il te faut des rtx6000 :o


---------------
:wq
n°47644
gremi
Vieux con des neiges d'antan
Posté le 04-09-2026 à 15:09:06  profilanswer
 

seu a écrit :


 
je ne suis pas pressé. Mais je peux avoir des 3090, ça serait peut être mieux non ?  :D


La Vram (et sa bande passante) c'est LE nerf de la guerre :D


---------------
In aligot we trust.
n°47645
the_fennec
f3nn3cUs z3rd4
Posté le 04-09-2026 à 15:14:05  profilanswer
 

seu a écrit :


 
je ne suis pas pressé. Mais je peux avoir des 3090, ça serait peut être mieux non ?  :D


 
Clairement, une paire de 3090 et tu es le roi :)
 
Ça de permettra de suive le club des 3090:
https://github.com/noonghunna/club-3090


---------------
Faudra que je teste un jour :o
n°47646
M300A
Posté le 04-09-2026 à 15:17:03  profilanswer
 

Oui il y a aussi ça : il y a des setup qui sont classiques, et du coup tu trouves beaucoup de recettes pour les faire tourner. Quand t'as des cartes un peu exotiques ou un nombre exotique c'est le saut dans l'inconnu

 

T'as la même chose pour les RTX6000 en 2/4/8:
https://github.com/local-inference-lab/rtx6kpro


Message édité par M300A le 04-09-2026 à 15:18:14

---------------
:wq
n°47652
neo world
Posté le 04-09-2026 à 15:51:58  profilanswer
 

seu a écrit :


 
je ne suis pas pressé. Mais je peux avoir des 3090, ça serait peut être mieux non ?  :D


bienvenue !
 
carrément oui grâce au nvlink. Tu peux aussi voir pour faire un essai en cloud (c'est débile pour le côté privacy mais si tu n'as pas de problèmes légaux à réutiliser d'anciens appels d'offres sur gemini ben ... c'est bon dans un environnement cloud avec des garanties similaires) [:sysman:4]  
 
Vous avez fait des essais avec notebookLM ? normalement c'est inclus dans votre abo et ça vous donnera une bonne idée de ce que vous pouvez esperer de votre tas de PDF sans que ça vous coûte 1centime :jap:


Message édité par neo world le 04-09-2026 à 15:52:41
n°47653
speedboyz3​0
Guide Michelin :o
Posté le 04-09-2026 à 15:57:54  profilanswer
 

https://minisforumpc.eu/products/mi [...] 1-max-p495
 
Minisforum AMD Ryzen™ AI Max+ PRO 495 >7000 euros ?  [:moonbloood:2]  [:la chancla:1]

n°47654
neo world
Posté le 04-09-2026 à 16:03:27  profilanswer
 

79,99€  [:manfoo:4]  :o


Message édité par neo world le 04-09-2026 à 16:04:21
n°47656
speedboyz3​0
Guide Michelin :o
Posté le 04-09-2026 à 16:04:40  profilanswer
 

C’est ptet juste pour faire du buzz oui.  
 
https://videocardz.com/newz/lenovo- [...] n-november
 

Citation :

Lenovo confirms the Ryzen AI Max+ PRO 495, Radeon 8065S with up to 96GB allocated graphics memory, 128GB LPDDR5X-8533 and the full I/O configuration in its specification table. The four-system clustering feature is also part of Lenovo’s announcement.
 
The Lenovo ThinkCentre X Ultra is scheduled to...
 
Source: VideoCardz.com
https://videocardz.com/newz/lenovo- [...] n-november

n°47658
the_fennec
f3nn3cUs z3rd4
Posté le 04-09-2026 à 16:22:54  profilanswer
 

speedboyz30 a écrit :

https://minisforumpc.eu/products/mi [...] 1-max-p495
 
Minisforum AMD Ryzen™ AI Max+ PRO 495 >7000 euros ?  [:moonbloood:2]  [:la chancla:1]


 
Est-ce qu'ils offrent le kit de montage de clodo pour rack?
https://i.imgur.com/cUeNauU.png
 
En plus ya que 160GB d'adressable sur les 192GB :D


---------------
Faudra que je teste un jour :o
n°47661
neo world
Posté le 04-09-2026 à 16:34:49  profilanswer
 

Une étagère sur coulisses et t’es mieux servi :D

n°47667
the_fennec
f3nn3cUs z3rd4
Posté le 04-09-2026 à 17:47:31  profilanswer
 

Test alacon du jour:  
DeepSeek-V4-Flash-REAP-IQ2XXS-w2Q2K-AProjQ8-OutQ8-chat-v2.gguf
 
Je retrouve plus la source :D
PP a 7/s TG a 1.8/s :o
 
Je vais pas le laisser finir et libérer 56GB de mon stockage!


Message édité par the_fennec le 04-09-2026 à 17:49:33

---------------
Faudra que je teste un jour :o
n°47673
neo world
Posté le 04-09-2026 à 18:07:46  profilanswer
 

moi je suis en train de dégager le qwen 3.8 flash next de chez atomic chat : aucun problème sur la generation de code / appels d'outils jusqu'à ce qu'il touche à OCR (open code review) ça le fait péter un câble en très peu de temps. J'ai laissé tourner une nuit et si au début ça allait il a très vite générer des "/" (genre 4M en 8h. super stats en token generation : 144 tok/s. bravo super modèle :o)
 
je repasse en Q4 K XL :jap:
 
pour ceux qui passeraient et auraient le même problème : même avec une pénalité forte sur la répétition ou un peu de tweak sur la reflexion ne change rien. Il veut que slasher :o


Message édité par neo world le 04-09-2026 à 18:11:14
n°47674
the_fennec
f3nn3cUs z3rd4
Posté le 04-09-2026 à 18:16:19  profilanswer
 

Pareil, je suis arrivé a //// assez vite malgré la lenteur de mon setup. J'avais jamais trop regardé AtomicChat, mais la j'y toucherais plus. J'ai vu par mal de commentaires sur Reddit qui sont aussi suspicieux a cause de la taille de son modèle.
 
La je suis en train de DL des REAM de mradermacher pour voir:
https://huggingface.co/mradermacher [...] ct-i1-GGUF


---------------
Faudra que je teste un jour :o
n°47676
neo world
Posté le 04-09-2026 à 18:36:08  profilanswer
 

finalement c'pas très cher :o
 
https://rehost.diberie.com/Picture/Get/f/541352

n°47677
neo world
Posté le 04-09-2026 à 18:38:02  profilanswer
 

the_fennec a écrit :


 
...
En plus ya que 160GB d'adressable sur les 192GB :D


pas forcément, sur le Halo strix tu peux overide le max adressable via la config des GTT. Techniquement je limite à 119GO (c'est agressif certes) mais je dépasse largement les 96GO adressables par défaut par le GPU :jap:

Message cité 1 fois
Message édité par neo world le 04-09-2026 à 18:38:16
n°47688
the_fennec
f3nn3cUs z3rd4
Posté le 04-09-2026 à 19:47:20  profilanswer
 


 
On peut pas commander à ce prix :cry:  
 

neo world a écrit :


pas forcément, sur le Halo strix tu peux overide le max adressable via la config des GTT. Techniquement je limite à 119GO (c'est agressif certes) mais je dépasse largement les 96GO adressables par défaut par le GPU :jap:


 
C'est ce que je pensais, mais laisser 32GB a l'OS c'est du gâchis. 2GB max sur une Debian propre.


---------------
Faudra que je teste un jour :o
n°47693
neo world
Posté le 04-09-2026 à 20:47:06  profilanswer
 

the_fennec a écrit :

Pareil, je suis arrivé a //// assez vite malgré la lenteur de mon setup. J'avais jamais trop regardé AtomicChat, mais la j'y toucherais plus. J'ai vu par mal de commentaires sur Reddit qui sont aussi suspicieux a cause de la taille de son modèle.
 
La je suis en train de DL des REAM de mradermacher pour voir:
https://huggingface.co/mradermacher [...] ct-i1-GGUF


C'est con parce qu'en mode pi "mint" il a tourné 8h sans problème avec 1,3M de tokens produits. Mais dés que j'ai voulu faire tourner OCR les problèmes ont commencé.

n°47720
neo world
Posté le 04-09-2026 à 22:59:27  profilanswer
 

Bon après trois jours de run (enfin debug surtout :o) faut que j'affine mon setup
=> Qwen 3.8 Flash next Q4 K XL reste sur la partie dev : il bosse trop bien j'ai rien à redire (enfin jusqu'à la prochaine panne quoi :o). il est bon aussi sur la partie doc donc parfait il en garde la charge
=> Pi.dev me convient donc il reste pour le moment aussi
 
mais deux phases sont frustrantes :
1 - la validation de qualité de code est longue, elle nécessite pas mal de tokens mais n'a pas besoin d'accéder à mon infra. Faudrait probablement un deepseek flash v4 en mode cloud a pas cher pour faire tourner Open Code Review sur le repo seulement en mode lecture seule
 
Ca amène deux questions supplémentaires :
=> Faire un scan local préalable de "conneries" dans le repo / code (URL accessibles de l'exterieur, tokens d'authentification, IP publiques) pour faire un clean en profondeur avant de faire lire par une IA externe
=> faire un scan du rapport de qualité de code généré en mode "recherche de easter eggs / défaut de sécurité potentiels avant de le redonner à l'IA codeuse la main pour qu'il implémente les correctifs
 
Faut que je regarde quoi mettre pour la sécurité mais globalement doit y avoir beaucoup de trucs déjà disponibles / assez facile à faire développer
 
2 - La discussion avec l'IA. Je ne veux pas attendre N minutes pour avoir un ETA de la tâche en cours ou avoir une idée de ce qu'il passe. Il faudrait que je test (en réalité que je mette en place) un autre agent dont le boulot est de vérifier ce que foutent les autres agents, est-ce qu'ils sont bloqués quelque part (voir est-ce que c'est parti en loop infinie) et faire le nécessaire pour les remettre en état ou me prévenir le cas échéant, éventuellement lui permettre de mettre en pause une tâche en cours pour prioriser un nouveau projet (plus rapide à délivrer ou plus urgent)
=> Idéalement en local. Si claude est en carafe ou passe en mode rogue je suis vraiment dans le  [:psedo:3]  
=> pas besoin d'un énorme modèle. Peut être qu'un BC250 ou un Mac mini ou possiblement un smartphone avec NPU serait une bonne idée pour ça ?
 
Les prochaine grosses urgences seront le SIEM (je suis complètement spectateur de ce que fait mon IA dans son environnement) et la partie CI/CD comme c'est elle qui devra déclencher les scans de sécurité puis les scans de vérification/validation avant le push to prod (vraisemblablement des LXC proxmox pour ça reste simple à gérer / maintenir)
 
Bon week-end :D
 
Edit :
j'allais oublié mais Claude reste sur la partie proto / aide à l'architecture / assistance à l'humain. C'est pas cher si tu lui fait pas cracher du token par millions et diablement efficace et rapide

Message cité 1 fois
Message édité par neo world le 04-09-2026 à 23:04:07
n°47735
AllenMadis​on
Oracle du Keb's
Posté le 05-09-2026 à 08:03:49  profilanswer
 

seu a écrit :

 

Pour l'instant l'hardware n'est pas folichon :

 

5900X , 32 Go de ram, un SSD de 500 go et une 4060 TI de 8go (avec possibilité de doubler la ram et de rajouter une 4060TI)

 

J'ai plusieurs objectifs :  créer un LLM capable d'analyser des documents de marchés public, de les analyser afin d'accélérer leur traitement (Gros PDF, excel, et DWG)

 

dans l'idée :

 

- Qu'il soit capable de faire une base de donnée de prix tirée de nos projets
- qu'ils soit capable de rédiger des documents en fonction d'une trame donnée
- qu'il soit capable d'analyser des documents et en faire des résumés.

 

Pour l'instant on utilise gémini Pro ou bien encore Copilot.   Mais nous travaillons de plus en plus sur de gros projet avec des NDA conséquents, et j'ai peur que bientôt on nous interdise l'utilisation de LLM pas vraiment sécurisés sur la fuite de données.

 

Pour te répondre, si c'est la partie software que tu demandes (parce que j'ai l'impression qu'en fait il te faut une idée de la partie hardware POUR le software, les deux vont ensemble en fait) :

 

- Pour la partie hardware, pour faire tourner correctement des IA (voire pour la lecture de gros documents), il te faudra au moins des rtx pro blackwell (comme dit) ET beaucoup de ram. Ca consomme pas mal.
- Pour la partie software, c'est plus compliqué :

 

1. Avec ton matos actuel, tu pourras bidouiller/faire mumuse pour te donner une idée de comment configurer, ce qu'il faut du point de vue software - commence par un bête ollama qwen en local, et vois comment tu peux l'installer, puis vois ce qu'il est possible de faire avec ta potite carte. Normalement, pour la partie software, on commence tous par là pour "se faire la main". Tu verras que c'est pas tres rapide, pas tres perf, c'est bien pour du local domestique pour des taches pas tres lourdes. A titrer perso je l'ai utilisé (pour tester) pour analyser des documents financiers d'entreprise (qwen9b de mémoire...) avec une petite 3080, et l'output n'était pas terrible mais ça faisait quand meme le taf.
2. mais ensuite tu vas tomber dans toute la partie software (quel modèle, quelle quantisation, qu'est-ce qu'il faut comme hardware pour aller avec le modèle d'IA que tu veux implémenter, qu'est-ce qui existe comme hardware qui soit acceptable/bon rapport qualité prix), comment est-ce qu'on configure ce hardware, comment on veut s'en servir (simple page web ou on upload/prompt ou bien harness type Hèrmes...).
3. Ensuite tu tomberas dans toute la partie optimisation en fonction des parametres des modèles...

 

Si tu veux entrainer un modèle pour toi même, comme dit, soit il va falloir être patient, soit il va falloir du compute. Pour te donner un ordre de grandeur, le dernier ChatGPT Astra a été entrainé sur 100.000 GPUs pendant 3 à 4 mois. Au doigt mouillé, faire de l'entrainement perso (et correct) d'un modèle il faudrait minimum x8 gpus H100 sur une station qui coute 100k€ et beaucoup de patience :o

Message cité 1 fois
Message édité par AllenMadison le 05-09-2026 à 08:10:08

---------------
Nothing much to teach, man. There's ze high, there's ze low and yall still fucking miss.
n°47739
tfpsly
Sly
Posté le 05-09-2026 à 08:55:51  profilanswer
 

tfpsly a écrit :


Merci. Mais... pi.dev a du mal à debugger mon projet avec un contexte de 32k. Je suis obligé de monter à 45k, et n'avoir que 30tk/s, pour avoir un agent plus compétent. A explorer plus - peut-être un pb dans ma config de pi.dev, qui compresse le contexte trop vite ou mal... Mais je monte rapidement à 64% d'utilisation du contexte.


the_fennec a écrit :


Oui, 32k c'est pas beaucoup pour du code.


Je confirme. J'ai réussi à monter à 160k de contexte, 45 tk/s (prompt processing ~ 400 tk/s) et j'utilise désormais OpenCode (plus stable/meilleur que pi.dev pour les sessions longues et la gestion d'erreur de communication avec Llama et retry).
EDIT - repassé sur pi.dev : je le trouve plus rapide; et trop impatient, j'aime bien voir le progrès de ses réflexion, alors qu'OpenCode attend la fin de sa réflexion pour pondre directement le résultat. Et avec 160k de contexte, je n'ai plus de coupure de communication LLM-pi qui le faisait s'arrêter.  
 
J'ai enfin un agent rapide et capable de bosser longtemps sur des tâches complexes. Plus lent que ce que l'on a au boulot (bien plus rapide, et j'en lance plusieurs en parallèle), mais très bien pour mes projets persos plus petits.
 

Code :
  1. llama-server -m ~/models/Qwen3.6-35B-A3B-APEX-I-Compact.gguf --host 0.0.0.0 --port 8080 \
  2.  -fa on --ctx-size 160000 -n -1 --threads 6 --threads-batch 6 \
  3.  --cpu-range 0-5 --cpu-strict 1 --cpu-range-batch 0-5 --cpu-strict-batch 1 --mmap --parallel 1 \
  4.  --cache-type-k q4_0 --cache-type-v q4_0 --ubatch-size 512 --batch-size 512 --metrics


Et dans ~/.config/opencode/opencode.jsonc :

Code :
  1. ...
  2. {
  3.   "$schema": "https://opencode.ai/config.json",
  4.   "provider": {
  5.       [...]
  6.       "models": {
  7.         "qwen-3.6": {
  8.           "id": "Qwen3.6",
  9.           "name": "Llama local",
  10.           "contextWindow": 160000,
  11.           "maxTokens": 4096
  12.         }
  13.       }
  14.     }
  15.   },
  16.   "model": "local-llama/qwen-3.6",
  17.   "permission": {
  18.     "edit": "allow",
  19.     "read": "allow",
  20.     "glob": "allow",
  21.     "grep": "allow",
  22.     "question": "allow"
  23.   },
  24.   "experimental": {
  25.     "continue_loop_on_deny": true
  26.   }
  27. }

Message cité 2 fois
Message édité par tfpsly le 08-09-2026 à 00:01:01
n°47742
Pipould's
Posté le 05-09-2026 à 09:41:58  profilanswer
 

tfpsly a écrit :


Je confirme. J'ai réussi à monter à 160k de contexte, 45 tk/s (prompt processing ~ 400 tk/s) et j'utilise désormais OpenCode (plus stable/meilleur que pi.dev pour les sessions longues et la gestion d'erreur de communication avec Llama et retry).

 

J'ai enfin un agent rapide et capable de bosser longtemps sur des tâches complexes. Plus lent que ce que l'on a au boulot (bien plus rapide, et j'en lance plusieurs en parallèle), mais très bien pour mes projets persos plus petits.

 
Code :
  1. llama-server -m ~/models/Qwen3.6-35B-A3B-APEX-I-Compact.gguf --host 0.0.0.0 --port 8080 \
  2.  -fa on --ctx-size 160000 -n -1 --threads 6 --threads-batch 6 \
  3.  --cpu-range 0-5 --cpu-strict 1 --cpu-range-batch 0-5 --cpu-strict-batch 1 --mmap --parallel 1 \
  4.  --cache-type-k q4_0 --cache-type-v q4_0 --ubatch-size 512 --batch-size 512 --metrics


Et dans ~/.config/opencode/opencode.jsonc :

Code :
  1. ...
  2. {
  3.   "$schema": "https://opencode.ai/config.json",
  4.   "provider": {
  5.       [...]
  6.       "models": {
  7.         "qwen-3.6": {
  8.           "id": "Qwen3.6",
  9.           "name": "Llama local",
  10.           "contextWindow": 160000,
  11.           "maxTokens": 4096
  12.         }
  13.       }
  14.     }
  15.   },
  16.   "model": "local-llama/qwen-3.6",
  17.   "permission": {
  18.     "edit": "allow",
  19.     "read": "allow",
  20.     "glob": "allow",
  21.     "grep": "allow",
  22.     "question": "allow"
  23.   },
  24.   "experimental": {
  25.     "continue_loop_on_deny": true
  26.   }
  27. }


 

Pourquoi pas Claude code simplement ?

n°47744
neo world
Posté le 05-09-2026 à 10:14:45  profilanswer
 

AllenMadison a écrit :


 
Pour te répondre, si c'est la partie software que tu demandes (parce que j'ai l'impression qu'en fait il te faut une idée de la partie hardware POUR le software, les deux vont ensemble en fait) :  
 
- Pour la partie hardware, pour faire tourner correctement des IA (voire pour la lecture de gros documents), il te faudra au moins des rtx pro blackwell (comme dit) ET beaucoup de ram. Ca consomme pas mal.  
- Pour la partie software, c'est plus compliqué :  
 
1. Avec ton matos actuel, tu pourras bidouiller/faire mumuse pour te donner une idée de comment configurer, ce qu'il faut du point de vue software - commence par un bête ollama qwen en local, et vois comment tu peux l'installer, puis vois ce qu'il est possible de faire avec ta potite carte. Normalement, pour la partie software, on commence tous par là pour "se faire la main". Tu verras que c'est pas tres rapide, pas tres perf, c'est bien pour du local domestique pour des taches pas tres lourdes. A titrer perso je l'ai utilisé (pour tester) pour analyser des documents financiers d'entreprise (qwen9b de mémoire...) avec une petite 3080, et l'output n'était pas terrible mais ça faisait quand meme le taf.  
2. mais ensuite tu vas tomber dans toute la partie software (quel modèle, quelle quantisation, qu'est-ce qu'il faut comme hardware pour aller avec le modèle d'IA que tu veux implémenter, qu'est-ce qui existe comme hardware qui soit acceptable/bon rapport qualité prix), comment est-ce qu'on configure ce hardware, comment on veut s'en servir (simple page web ou on upload/prompt ou bien harness type Hèrmes...).  
3. Ensuite tu tomberas dans toute la partie optimisation en fonction des parametres des modèles...  
 
Si tu veux entrainer un modèle pour toi même, comme dit, soit il va falloir être patient, soit il va falloir du compute. Pour te donner un ordre de grandeur, le dernier ChatGPT Astra a été entrainé sur 100.000 GPUs pendant 3 à 4 mois. Au doigt mouillé, faire de l'entrainement perso (et correct) d'un modèle il faudrait minimum x8 gpus H100 sur une station qui coute 100k€ et beaucoup de patience :o


En fait pour faire un RAG y'a pas du tout besoin d'une grosse infra et je pense que ce serait beaucoup plus adapté à son besoin.
 
 
Y'a quand même plusieurs choses à avoir en tête :
- Sur ce qui est identique entre appels d'offre ça fera probablement un job correct (mais relecture / correction obligatoire derrière. C'est un LLM bon sang :o)
- Il faut que le dataset soit représentatif de vos appels d'offres en terme de part d'identique et de part non identique (idéalement tous les appels d'offres mais on revient rapidement au 8XH100 que tu lui propose
- Les llm sont pas faits pour des maths donc il faudra coder (ou faire coder) une app qui permet de convertir des besoins en charge facturable (licences, man days, frais divers) avec son MCP pour que le LLM puisse l'appeler.
 
Moi je pense que le 2X3090 permettra de faire quelques tests naïfs :  
- est-ce qu'on peut interroger une base de PDF (la réponse est oui)
- est-ce qu'en terme de qualité/vitesse le gap est gros avec ce que vous avez déjà (spoiler alert : oui :o)
- Est-ce que c'est juste une envie d'exploration (demande un dgx spark ? C'est pas si cher à environ 5k et ça permet de jouer dans d'assez bonnes conditions) ou un vrai besoin (RFP avec la défense / Renseignement / Armement / trucs stratégiques economico-souverains) faudra choper des experts pour vous guider un peu. Moi je pense que vous devez faire l'entrainement du RAG sur le cloud (aucun intéret de garder une infra qui se tourne les pouces 99% du temsp quand l'entrainement est fini. Prenez OVH / Outscale / scaleway si le côté souverain à du sens sinon si vous avez Gemini vous avez aussi du cloud ricain quelque part ... et vu que les PDF ont pas de conditions particulières (et sont anciens) normalement pas de problème
- Il faudra une infra pour la partie inférence en local. C'est l'expert qui pourra vous guider (DGX spark probablement suffisant ou RTX6000 pro si vous avez arrivez à justifier l'invest' avec le gain de rapidité / consolidation sur d'autres besoins)
 
Mais le projet en temps que tel me semble viable mais pas en mode apprendre en marchant par des équipes nons spécialisées : ca va finir en POC abandonné (mais si vous avez besoin de quelqu'un pour vous débarasser du DGX H100 ou du DGX spark comptez sur moi :o )

n°47745
neo world
Posté le 05-09-2026 à 10:15:45  profilanswer
 

Pipould's a écrit :


 
Pourquoi pas Claude code simplement ?


je pensais être sur le topic de l'IA locale :o

n°47746
the_fennec
f3nn3cUs z3rd4
Posté le 05-09-2026 à 10:18:45  profilanswer
 

tfpsly a écrit :


Je confirme. J'ai réussi à monter à 160k de contexte, 45 tk/s (prompt processing ~ 400 tk/s) et j'utilise désormais OpenCode (plus stable/meilleur que pi.dev pour les sessions longues et la gestion d'erreur de communication avec Llama et retry).
 
J'ai enfin un agent rapide et capable de bosser longtemps sur des tâches complexes. Plus lent que ce que l'on a au boulot (bien plus rapide, et j'en lance plusieurs en parallèle), mais très bien pour mes projets persos plus petits.
 

Code :
  1. llama-server -m ~/models/Qwen3.6-35B-A3B-APEX-I-Compact.gguf --host 0.0.0.0 --port 8080 \
  2.  -fa on --ctx-size 160000 -n -1 --threads 6 --threads-batch 6 \
  3.  --cpu-range 0-5 --cpu-strict 1 --cpu-range-batch 0-5 --cpu-strict-batch 1 --mmap --parallel 1 \
  4.  --cache-type-k q4_0 --cache-type-v q4_0 --ubatch-size 512 --batch-size 512 --metrics


Et dans ~/.config/opencode/opencode.jsonc :

Code :
  1. ...
  2. {
  3.   "$schema": "https://opencode.ai/config.json",
  4.   "provider": {
  5.       [...]
  6.       "models": {
  7.         "qwen-3.6": {
  8.           "id": "Qwen3.6",
  9.           "name": "Llama local",
  10.           "contextWindow": 160000,
  11.           "maxTokens": 4096
  12.         }
  13.       }
  14.     }
  15.   },
  16.   "model": "local-llama/qwen-3.6",
  17.   "permission": {
  18.     "edit": "allow",
  19.     "read": "allow",
  20.     "glob": "allow",
  21.     "grep": "allow",
  22.     "question": "allow"
  23.   },
  24.   "experimental": {
  25.     "continue_loop_on_deny": true
  26.   }
  27. }



 
 
C'est pas mal tout ça :jap:
Je te conseillerais d'essayer le template de froggeric qui règle pas mal de soucis:
https://huggingface.co/froggeric/Qw [...] -Templates
 
Ton maxTokens est tout petit, surtout si tu passes sur 3.8 un jour. J'ai pas trouvé d'avantage a le limiter, ça peut couper le thinking au mauvais moment ou juste finir avec des fichiers tronqués.
Il te reste quoi en VRAM? Si t'en as assez ça pourrait être mieux de diminuer le contexte pour passer le KV en Q8.
 
 


---------------
Faudra que je teste un jour :o
n°47747
the_fennec
f3nn3cUs z3rd4
Posté le 05-09-2026 à 10:26:56  profilanswer
 

neo world a écrit :

Bon après trois jours de run (enfin debug surtout :o) faut que j'affine mon setup
=> Qwen 3.8 Flash next Q4 K XL reste sur la partie dev : il bosse trop bien j'ai rien à redire (enfin jusqu'à la prochaine panne quoi :o). il est bon aussi sur la partie doc donc parfait il en garde la charge
=> Pi.dev me convient donc il reste pour le moment aussi
 
mais deux phases sont frustrantes :
1 - la validation de qualité de code est longue, elle nécessite pas mal de tokens mais n'a pas besoin d'accéder à mon infra. Faudrait probablement un deepseek flash v4 en mode cloud a pas cher pour faire tourner Open Code Review sur le repo seulement en mode lecture seule
 
Ca amène deux questions supplémentaires :
=> Faire un scan local préalable de "conneries" dans le repo / code (URL accessibles de l'exterieur, tokens d'authentification, IP publiques) pour faire un clean en profondeur avant de faire lire par une IA externe
=> faire un scan du rapport de qualité de code généré en mode "recherche de easter eggs / défaut de sécurité potentiels avant de le redonner à l'IA codeuse la main pour qu'il implémente les correctifs
 
Faut que je regarde quoi mettre pour la sécurité mais globalement doit y avoir beaucoup de trucs déjà disponibles / assez facile à faire développer
 
2 - La discussion avec l'IA. Je ne veux pas attendre N minutes pour avoir un ETA de la tâche en cours ou avoir une idée de ce qu'il passe. Il faudrait que je test (en réalité que je mette en place) un autre agent dont le boulot est de vérifier ce que foutent les autres agents, est-ce qu'ils sont bloqués quelque part (voir est-ce que c'est parti en loop infinie) et faire le nécessaire pour les remettre en état ou me prévenir le cas échéant, éventuellement lui permettre de mettre en pause une tâche en cours pour prioriser un nouveau projet (plus rapide à délivrer ou plus urgent)
=> Idéalement en local. Si claude est en carafe ou passe en mode rogue je suis vraiment dans le  [:psedo:3]  
=> pas besoin d'un énorme modèle. Peut être qu'un BC250 ou un Mac mini ou possiblement un smartphone avec NPU serait une bonne idée pour ça ?
 
Les prochaine grosses urgences seront le SIEM (je suis complètement spectateur de ce que fait mon IA dans son environnement) et la partie CI/CD comme c'est elle qui devra déclencher les scans de sécurité puis les scans de vérification/validation avant le push to prod (vraisemblablement des LXC proxmox pour ça reste simple à gérer / maintenir)
 
Bon week-end :D
 
Edit :
j'allais oublié mais Claude reste sur la partie proto / aide à l'architecture / assistance à l'humain. C'est pas cher si tu lui fait pas cracher du token par millions et diablement efficace et rapide


 
Perso, au taf, j'aime pas trop switcher de modèle pour faire une tache différente. Je trouve que chaque famille de modèle (Opus, GPT, etc.) est trop différente et introduit des différences de style si on les laisses trop faire. Je préfère avoir un AGENTS.md différent et garder le même modèle. Genre en mode review, il n'a pas le droit de changer le code, juste créer/lancer des tests au pire.
Bon faut dire que j'en suis pas encore aux swarms :o

Message cité 1 fois
Message édité par the_fennec le 05-09-2026 à 10:28:06

---------------
Faudra que je teste un jour :o
n°47761
neo world
Posté le 05-09-2026 à 10:57:59  profilanswer
 

the_fennec a écrit :


 
Perso, au taf, j'aime pas trop switcher de modèle pour faire une tache différente. Je trouve que chaque famille de modèle (Opus, GPT, etc.) est trop différente et introduit des différences de style si on les laisses trop faire. Je préfère avoir un AGENTS.md différent et garder le même modèle. Genre en mode review, il n'a pas le droit de changer le code, juste créer/lancer des tests au pire.
Bon faut dire que j'en suis pas encore aux swarms :o


Faudra que je test un jour © :o
 
En fait je me dis que c'est équivalent au code review du boulot : trois inge n'ont pas le même style pourtant le second vérifie le code du premier et le troisième sert à désamorcer en cas de "conflit stérile"
 
Et pour avoir vu des code review salés :
code une fonction et mets en dur un chiffre en variable sans explication
Le reviewer demande "what is this value ?"
réponse du codeur (humain) : "number N" (littéralement zero explication. nothing. Le gars bosse toujours chez nous  :lol: )
 
 :pt1cable:  
 
Je préfère que ça se fight un peu sur la qualité avec pourquoi pas une IA "quorum" en cas de blocage mais bref faudra que je test un jour comme dirait l'autre :o

n°47767
tfpsly
Sly
Posté le 05-09-2026 à 11:19:30  profilanswer
 

the_fennec a écrit :


C'est pas mal tout ça :jap:
Je te conseillerais d'essayer le template de froggeric qui règle pas mal de soucis:
https://huggingface.co/froggeric/Qw [...] -Templates

 

Ton maxTokens est tout petit, surtout si tu passes sur 3.8 un jour. J'ai pas trouvé d'avantage a le limiter, ça peut couper le thinking au mauvais moment ou juste finir avec des fichiers tronqués.
Il te reste quoi en VRAM? Si t'en as assez ça pourrait être mieux de diminuer le contexte pour passer le KV en Q8.


Occupation VRAM : 10986MiB /  12288MiB - il me reste 1,2 gb.
OK, je vais augmenter le maxTokens à 16k et tester ce template jinja. De mémoire, j'avais enlever jinja pour essayer de corriger pi.dev qui s'arrêtait ou n'arrivait plus à parser un message.
Pour le moment ça passe à l'aise.
Merci :jap:

Message cité 1 fois
Message édité par tfpsly le 05-09-2026 à 12:10:38
n°47799
moyen_moin​s
chat réincarné
Posté le 05-09-2026 à 14:57:02  profilanswer
 

Personne a encore testé le k2-horizon en MoE ?

n°47802
neo world
Posté le 05-09-2026 à 16:09:41  profilanswer
 

en même temps vu le nombre de téléchargements y'a peu de chance que ce soit quelqu'un tu topic :o
 
https://rehost.diberie.com/Picture/Get/f/541564

n°47805
the_fennec
f3nn3cUs z3rd4
Posté le 05-09-2026 à 16:39:13  profilanswer
 

tfpsly a écrit :


Occupation VRAM : 10986MiB /  12288MiB - il me reste 1,2 gb.
OK, je vais augmenter le maxTokens à 16k et tester ce template jinja. De mémoire, j'avais enlever jinja pour essayer de corriger pi.dev qui s'arrêtait ou n'arrivait plus à parser un message.
Pour le moment ça passe à l'aise.
Merci :jap:


 
Je vote KV en Q8 avec tes 1.2GB restants.
 

moyen_moins a écrit :

Personne a encore testé le k2-horizon en MoE ?


 
Pas supporté encore:
https://github.com/ggml-org/llama.cpp/issues/28361
https://github.com/ggml-org/llama.cpp/discussions/28308


---------------
Faudra que je teste un jour :o
n°47806
neo world
Posté le 05-09-2026 à 16:39:40  profilanswer
 

rapport open code review  
 

Citation :

### High Priority (6)                                                                                                        
                                                                                                                               
 - src/signature.mjs:36 — HMAC guard is on the wrong operand (auth bypass). The hex regex is applied to x (the locally        
   computed HMAC, always 64 lowercase hex) so it can never fire; the untrusted y from X-Nextcloud-Talk-Signature is never      
   format-checked. Buffer.from(y,"hex" ) stops at the first non-hex char, so a 63-hex-char + "z" header decodes to the same 31  
   bytes → timingSafeEqual compares a truncated value.                                                                        
   Recommendation: validate the incoming header against /^[0-9a-f]{64}$/ before decoding, and compare byte lengths before      
   timingSafeEqual.                                                                                                            
 - src/pi-rpc.mjs:70 — env: process.env leaks the whole environment to the agent child, including NC_TALK_BOT_SECRET. The      
   child is a shell-capable agent driven by model output and its reply is posted verbatim to the room, so a prompt-injection  
   turn can print the bot secret into the conversation.                                                                        
   Recommendation: pass an explicit allowlist env (PATH, HOME, HOME/.pi state, model/provider auth only) instead of            
   process.env.                                                                                                                
 - src/attachments.mjs:214 — SSRF via redirect. The host allowlist is checked on item.url only, but the fetch uses redirect:  
   "follow"; a 3xx from the allowlisted Nextcloud host to any internal/attacker host is followed and the body is written to    
   the inbox and advertised as LOCAL COPY AVAILABLE.                                                                          
   Recommendation: redirect: "manual" and re-validate the allowlist on each hop.                                              
 - src/agent.mjs:131 — /reset silently does not forget when the room has no in-memory state (right after a connector restart,  
   or after the session-cap path deleted the entry): reset() bails before clearing the persisted index, so the next message    
   resumes the old context.                                                                                                    
   Recommendation: clear/delete the persisted index entry unconditionally, independent of in-memory state.                    
 - src/agent.mjs:191 — race between reset()/Leave and rpc.start(): st.rpc and the index are written after the await without    
   re-checking that the room state is still live, so an orphaned child is adopted back into a deleted state (resurrected      
   session + leaked child process).                                                                                            
   Recommendation: re-check this.rooms.get(key) === st after the await; kill the child if it no longer matches.                
 - src/pi-rpc.mjs:215 — sleep(timeoutMs) timer is never cleared on the win path, so every prompt leaves a live handle; a      
   short-lived process cannot exit (scripts/rpc-smoke.mjs prints PASS then hangs for the full timeout).                        
   Recommendation: keep the handle and clearTimeout() in a finally.                                                            
                                                                                                                               
 ### Medium Priority (grouped by file)                                                                                        
                                                                                                                               
 - src/attachments.mjs (5 more) — :233 size cap enforced only after the whole body is in RAM (no content-length → OOM the      
   connector); :205 host pin fails open if allowedHosts is missing/empty; :239 Date.now() filename collides for two            
   attachments in the same millisecond (silent overwrite, wrong file handed to the agent); :115 safeName(name, name) passes    
   the unsanitized value as its own fallback, so "..."/" . " bypass the sanitizer; :227 response body never                    
   consumed/cancelled on !res.ok and too-large paths → socket leak on 404 bursts; :219 no content-type/link-vs-download-URL    
   check, so Nextcloud's HTML share page gets saved as Q3 report.pdf.                                                          
 - src/agent.mjs — :48 Math.max(60_000, Number(x)) → NaN for a non-numeric NC_TALK_IDLE_REAP_MS, and NaN || 0 makes            
   setInterval(fn, 0) fire ~every ms while cutoff is NaN, so every agent is reaped every tick; :161 enforceSessionCap() can    
   evict the just-created room (only pending > 0 is skipped) → user gets could not start the agent; :228 captured pi stderr    
   is posted into the room (redact() only strips the bot secret) — auth/host diagnostics broadcast to room members incl.      
   guests; :144 dispose() has no terminal flag → a queued submit() spawns a fresh pi child after SIGTERM → orphan.            
 - src/pi-rpc.mjs:194 — done resolves only on agent_settled; if the child dies, the turn waits the full timeout (default 10    
   min) before failing (the model later posted a corrected snippet of this same finding).                                      
 - src/text.mjs:127 — length measured in code points but cut with UTF-16 slice() → a cut between a surrogate pair turns both  
   halves into U+FFFD, silently corrupting emoji/emoji-run/astral text in both chunks.                                        
 - LICENSE:18 — MIT text is mangled: ANY CLAIM, LIABILITY OR LIABILITY should be ANY CLAIM, DAMAGES OR OTHER LIABILITY;        
   restore verbatim MIT (also breaks SPDX/REUSE detection).                                                                    
 - scripts/probe-webhook.mjs — :19 RANDOM is a compile-time constant, so re-running within the 600 s replay window gives a    
   false FAIL ... 409; :76 attempt() returns -1 on transport failure but the summary counts it as "unsigned refused", and      
   nothing sets process.exitCode → npm run probe exits 0 even when the connector was down (both negative security checks can  
   pass vacuously).                                                                                                            
 - test/helpers/mock-talk.mjs — :45 the mock never validates the request path, so a wrong API path/version is recorded as a    
   successful send; :95 server.close() + keep-alive sockets can stall t.after(), needs closeAllConnections().                  
 - Test gaps that hide real bugs: test/signature.test.mjs:70 (no same-length non-hex vector — the exact hexEquals throw        
   above), :85 the "rejects a repeated nonce" test never asserts a repeat, :75 newRandom() has zero coverage though its        
   64-hex contract is load-bearing; test/attachments.test.mjs:55/:103 no dot/whitespace-only-name cases, no 404 path,          
   attachmentMaxBytes never exercised.                                                                                        


                                                                                                                               
 [:clooney44]  
 

n°47809
the_fennec
f3nn3cUs z3rd4
Posté le 05-09-2026 à 16:48:58  profilanswer
 

neo world a écrit :


Faudra que je test un jour © :o
 
En fait je me dis que c'est équivalent au code review du boulot : trois inge n'ont pas le même style pourtant le second vérifie le code du premier et le troisième sert à désamorcer en cas de "conflit stérile"
 
Et pour avoir vu des code review salés :
code une fonction et mets en dur un chiffre en variable sans explication
Le reviewer demande "what is this value ?"
réponse du codeur (humain) : "number N" (littéralement zero explication. nothing. Le gars bosse toujours chez nous  :lol: )
 
 :pt1cable:  
 
Je préfère que ça se fight un peu sur la qualité avec pourquoi pas une IA "quorum" en cas de blocage mais bref faudra que je test un jour comme dirait l'autre :o


 
 :lol: pas mal. Il y a longtemps je bossais avec un gars qui supportait pas qu'on touche a "son code" et refaisait systématiquement tous les changements. Et pour bien montrer qu'il pensait a tout mieux que tout le monde testait toutes les valeurs possible partout, ce qui rendait son code imbitable :o (il est plus dans la boite :D).
 
Maintenant j'ai mon AGENTS.md qui code comme moi, et quand j'ai un commentaire dans une PR je l'applique tout de suite sans discuter. C'est quand même top pour les tests, c'était trop chiant a faire avant l'IA.
 
Pour le style on a des règles strictes et ça compile pas si c'est pas bon. On applique aussi les trucs de base de la programmation objet. Il y a rarement débat.


---------------
Faudra que je teste un jour :o
n°47821
neo world
Posté le 05-09-2026 à 19:08:59  profilanswer
 

neo world a écrit :

rapport open code review ..


Avis sans contexte d'Opus :
 

Citation :

Le noyau dur me paraît solide et vaut le rapport à lui seul :
 
SSRF par redirection (allowlist sur l'URL initiale, redirect: "follow" ) — la meilleure trouvaille, et le rapport note lui-même que le test existant ne couvre pas ce chemin.
env: process.env vers l'enfant pi.
Cap de taille appliqué après bufferisation complète → OOM déclenchable par un hôte hostile.
ReplayCache fail-open sur TTL ≤ 0, avec envInt qui accepte les négatifs.
Injection de lignes dans l'EnvironmentFile systemd via newline dans une valeur.
safeName(name, name) qui se contourne lui-même.
Seuils incohérents 4 vs 6 dans logger.mjs, avec valeur de retour trompeuse.
 
Ceux-là je les corrigerais en priorité, dans cet ordre, sans attendre le reste.
 
En pratique : traite les sections High/Medium/Low comme des pistes de départ classées par « à regarder d'abord », pas par gravité. Réécris les trois entrées contredites par la vérification. Et si l'outil doit servir de gate CI un jour, il lui faut un moyen de marquer un finding comme corrigé ou rejeté, sinon chaque passe repartira à 118.


 
pour la suite je vais faire tourner la correction puis refaire une verification par OCR et enfin (enfin !) comparer avec ce que trouve claude opus 5 à partir du code source
 
Si opus est ultra verbeux ce sera mauvais signe pour mon setup  [:alain haque-barre:3]  [:alain haque-barre:4]  [:alain haque-barre:5] :o

n°47845
the_fennec
f3nn3cUs z3rd4
Posté le 05-09-2026 à 21:13:58  profilanswer
 

Bon c'est fini pour les BC250 bon marché :o
 
LTT Parle de la BC250
https://youtu.be/lmLh29LE2W4
 
Rien de neuf, mais les prix vont probablement monter.


---------------
Faudra que je teste un jour :o
n°47847
neo world
Posté le 05-09-2026 à 21:28:19  profilanswer
 

the_fennec a écrit :

Bon c'est fini pour les BC250 bon marché :o
 
LTT Parle de la BC250
https://youtu.be/lmLh29LE2W4
 
Rien de neuf, mais les prix vont probablement monter.


j'ai vraiment hésité cet après midi mais entre l'alim qui dégueule à côté et la conso au repos c'est juste pas bon pour mon usage. Ce sera soit smartphone soit modèle cloud qui ne peut que envoyer des messages à copier dans un salon auquel il n'a pas accès pour executer les commandes en local.
Encore un beau bordel. J'aurai jamais fini cette année :o

n°47848
the_fennec
f3nn3cUs z3rd4
Posté le 05-09-2026 à 21:30:42  profilanswer
 

neo world a écrit :


j'ai vraiment hésité cet après midi mais entre l'alim qui dégueule à côté et la conso au repos c'est juste pas bon pour mon usage. Ce sera soit smartphone soit modèle cloud qui ne peut que envoyer des messages à copier dans un salon auquel il n'a pas accès pour executer les commandes en local.
Encore un beau bordel. J'aurai jamais fini cette année :o


 
Faudrait une IA pour s'en occuper :o


---------------
Faudra que je teste un jour :o
n°47849
neo world
Posté le 05-09-2026 à 21:48:24  profilanswer
 

C’est ce que je fais. Je passe mes nuits à prompter pour intégrer des composants. La je fini l’intégration un SIEM (wazuh) pour surveiller ce que font mes agents :D

n°47886
the_fennec
f3nn3cUs z3rd4
Posté le 06-09-2026 à 11:49:59  profilanswer
 

Je voulais dire donner un budget à une IA pour qu'elle achète des trucs.


---------------
Faudra que je teste un jour :o
n°47889
neo world
Posté le 06-09-2026 à 11:59:25  profilanswer
 

pour finir avec une 1065 rebadgée 5090 à seulement 800 balles sur wish ? :o

n°47946
moyen_moin​s
chat réincarné
Posté le 06-09-2026 à 15:29:02  profilanswer
 

Je suis en train de tester un truc depuis quelques jours mais pour des raisons de "confidentialité", je m'oblige à faire ça en local.
J'utilise donc un Qwen 3.8 en Q4_K_M avec MTP sur mon combo 9070xt+9060xt. J'arrive à monter à 155k de contexte (il y a un réel besoin) avec kv cache en q8 (29GB de pris).
Bon outre les problèmes de drivers et de fuite mémoire de firefox qui font planter le pc de temps en temps (faudrait pas dépasser 27.5-28GB apparemment), je me retrouve à générer quand même pas mal de tokens.

 

Bref, hier soir j'ai essayé de lancer une "analyse" : 4-5 étapes avec revue, en moyenne par étape, ça génère entre 30000 et quasi 60000 tokens (voire plus entre 15 à 20 t/s mais prefill entre 150 et 180t/s sur la longueur) en fonction de la taille du contexte.
Bon, on va pas se mentir, c'est long car il y a une validation humaine nécessaire de l'analyse à la fin de chaque étape.
D'ici quelques semaines/mois, je compte investir pour mon petit hobby (cramer de l'électricité donc) :o
Disons fin d'année, début d'année prochaine.

 

Quel est, selon vous, le meilleur investissement à faire dans un budget d'environ 4-5k ? Je suppose qu'avec ce genre de budget, on resterait dur des modèles denses de 27-30B ou des MoE de 120B mais ça devrait largement me suffire.  :jap:

Message cité 1 fois
Message édité par moyen_moins le 06-09-2026 à 16:08:14
 Page :   1  2  3  4  5  ..  56  57  58  59  60  61

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)