Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
3041 connectés 

 


Je génère ...
Sondage à 3 choix possibles.
Ce sondage expirera le 20-09-2026 à 10:00




Attention si vous cliquez sur "voir les résultats" vous ne pourrez plus voter

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  52  53  54  ..  56  57  58  59  60  61
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°47030
AllenMadis​on
Oracle du Keb's
Posté le 31-08-2026 à 23:04:44  profilanswer
 

Reprise du message précédent :

neo world a écrit :


Mac studio ultra  [:benzema_is_useless]

 

Medusa halo en 2027 pfft.

 

Ecoutez l'oracle et attendez un an les gars :o


Message édité par AllenMadison le 31-08-2026 à 23:07:18

---------------
Nothing much to teach, man. There's ze high, there's ze low and yall still fucking miss.
n°47032
neo world
Posté le 31-08-2026 à 23:10:26  profilanswer
 

ce serait vraiment la première fois qu'AMD foire un produit et déçoit ceux qui attendent :o :o :o

n°47037
neo world
Posté le 01-09-2026 à 01:02:35  profilanswer
 

Code :
  1. 0.00.018.542 I cmn  common_param: common_params_print_info: verbosity = 3 (adjust with the `-lv N` CLI arg)
  2. 0.00.018.761 W srv  llama_server: -----------------
  3. 0.00.018.761 W srv  llama_server: CORS is set to allow all origins ('*') and no API key is set
  4. 0.00.018.762 W srv  llama_server: this can be a security risk (cross-origin attacks)
  5. 0.00.018.762 W srv  llama_server: more info: https://github.com/ggml-org/llama.cpp/pull/25655
  6. 0.00.018.762 W srv  llama_server: -----------------
  7. 0.00.020.233 I srv    load_model: loading model '/srv/models/Qwen3.8-Flash-Next/Qwen3.8-Flash-Next-AD-4.27bpw-Q4_K_M-M64/Qwen3.8-Flash-Next-AD-4.27bpw-Q4_K_M-M64-00001-of-00033.gguf'
  8. 0.14.603.686 I cmn          init: llama threadpool init, n_threads = 16
  9. 0.14.831.303 I srv    load_model: initializing, n_slots = 4, n_ctx_slot = 125184, kv_unified = 'true'
  10. 0.14.834.128 I srv          init: chat template supports preserving reasoning, consider enabling it via --reasoning-preserve
  11. 0.14.834.169 I srv  llama_server: model loaded
  12. 0.14.834.175 I srv  llama_server: listening on http://127.0.0.1:8091


 
14 secondes pour charger le modèle en mémoire (vous inquiétez pas de l'absence https, l'écoute sur le loopback uniquement et l'absence de jeton d'auth : tout ça est géré dans un sandwich salade tomate oignon lemonade / caddy donc c'est propre quand c'est sur le réseau) Ces gens sont des malades :o
 
en PP ça tourne entre 320 et 250 tokens / seconds . J'ai quand même demandé un truc complexe à openclaw : "are you well ?" ce qui a donné une requête de 17090 tokens (j'imagine qu'il résolvait le cancer en parallèle ? :o ) pour 89 tokens d'output  :pt1cable:
 
clairement des optimisations à aller chercher mais température stable so far :
https://rehost.diberie.com/Picture/Get/f/540354


Message édité par neo world le 01-09-2026 à 01:18:11
n°47040
neo world
Posté le 01-09-2026 à 01:55:55  profilanswer
 

Tronklou a écrit :

T'arrive après la guerre , hermess :O


Qui en plus d'être utilisable, de ne pas envoyer des commandes cheloues/tronquées à llama (qui le passait sans cesse en mode plain text pour le sauver) te préviens de ce qu'il fait et te demande l'autorisation sur les trucs vaguement dangereux.
 
Ah et parlons de la barre de nombre de tokens / % du context disponible qui fonctionne :o
 
Remboursez open claw !!!111!!!  [:charles k:1] :o :o


Message édité par neo world le 01-09-2026 à 01:58:13
n°47041
neo world
Posté le 01-09-2026 à 02:18:38  profilanswer
 

le contexte à 32000 tokens après 11 minutes d'échange. Ca engloutie des tokens plus vite que des tic tac :o
 
Si vous vous demandez quelle tâche hyper complexe je lui ait confié : se connecter à mon endpoint nextcloud talk et mettre en place un webhook en http simple pour récupérer les notifs / messages ...  :lol:
 
edit contexte de 66K tokens 32 minutes plus tard ... toujours pas de connection à Nextcloud en vue mais il bosse :o
Je vais p't'être finir par lui donner une solution moi même https://apps.nextcloud.com/apps/hermes_talk_bridge  
 
Mais merci pour le stress test sur un truc trivial :whistle:

Message cité 2 fois
Message édité par neo world le 01-09-2026 à 02:50:11
n°47043
the_fennec
f3nn3cUs z3rd4
Posté le 01-09-2026 à 08:10:21  profilanswer
 

tfpsly a écrit :


Merci. Mais... pi.dev a du mal à debugger mon projet avec un contexte de 32k. Je suis obligé de monter à 45k, et n'avoir que 30tk/s, pour avoir un agent plus compétent. A explorer plus - peut-être un pb dans ma config de pi.dev, qui compresse le contexte trop vite ou mal... Mais je monte rapidement à 64% d'utilisation du contexte.


 
Oui, 32k c'est pas beaucoup pour du code.
 

SynE a écrit :


J'ai deux bc250 mais en load balancing ...  


 
LB de LLM? Comment ça marche?


---------------
Faudra que je teste un jour :o
n°47044
the_fennec
f3nn3cUs z3rd4
Posté le 01-09-2026 à 08:17:24  profilanswer
 

neo world a écrit :

le contexte à 32000 tokens après 11 minutes d'échange. Ca engloutie des tokens plus vite que des tic tac :o
 
Si vous vous demandez quelle tâche hyper complexe je lui ait confié : se connecter à mon endpoint nextcloud talk et mettre en place un webhook en http simple pour récupérer les notifs / messages ...  :lol:
 
edit contexte de 66K tokens 32 minutes plus tard ... toujours pas de connection à Nextcloud en vue mais il bosse :o
Je vais p't'être finir par lui donner une solution moi même https://apps.nextcloud.com/apps/hermes_talk_bridge  
 
Mais merci pour le stress test sur un truc trivial :whistle:


 
Va voir les fichiers AGENTS,SOUL,IDENTITY, etc.
https://github.com/openclaw/opencla [...] /templates
 
Tu comprendras mieux pourquoi le chat de base bouffe 20k de contexte... C'est encore pire quand tu actives quelques skills/plugins.  
 
Ça présente bien pour une démo, mais ça part du principe que tu as 1M de contexte et un LLM frontier pour le moindre truc.


Message édité par the_fennec le 01-09-2026 à 08:18:22

---------------
Faudra que je teste un jour :o
n°47045
speedboyz3​0
Guide Michelin :o
Posté le 01-09-2026 à 09:07:17  profilanswer
 

Y a des M3 Ultra qui sont tombés sur le refurb. 96Go ram 820GB/s de bande passante pour 5200 euros.

 

On perd un peu de bande passante et les neural accelerators mais ça positionne bien dans l’étalement de la gamme :jap:
Entre le M3 Max 64 Go et le M5 Ultra 96Go.
Voilà voilà :o

Message cité 1 fois
Message édité par speedboyz30 le 01-09-2026 à 09:13:44
n°47047
AllenMadis​on
Oracle du Keb's
Posté le 01-09-2026 à 09:12:02  profilanswer
 

C'est reuch et a la fois pas reuch pour du Apple :o


---------------
Nothing much to teach, man. There's ze high, there's ze low and yall still fucking miss.
n°47050
neo world
Posté le 01-09-2026 à 09:47:32  profilanswer
 

3x la bande passante du strix halo pour 2 fois le prix et à peine moins de ram. Ça joue :D

n°47052
croustx
Modoadorateur
Posté le 01-09-2026 à 10:04:15  profilanswer
 

Hello,
 
Pour le taf, on cherche une machine pour faire tourner une IA en local.
 
On regarde du coté du DGX Spark - le rapport qualité prix semble pas "mauvais".
 
Vous avez des retours sur d'eventuelles autres solutions ?

n°47055
neo world
Posté le 01-09-2026 à 10:12:41  profilanswer
 

Mac m5 Max ou gamme ultra ou rtx 6000 pro. Pour la complétion de code le DGX spark est très bien mais pour de l’agentique ça va être compliqué d’être productif :jap:

n°47059
croustx
Modoadorateur
Posté le 01-09-2026 à 10:28:11  profilanswer
 

neo world a écrit :

mais pour de l’agentique ça va être compliqué d’être productif :jap:


 
 
Comment ça ?

n°47060
neo world
Posté le 01-09-2026 à 10:34:52  profilanswer
 

T’as pas lu mes messages du dessus :o
 
Les agents sont des ogres à token. Seul ou en mode homelab ça va. À 3 dessus ça n’ira pas :jap:

n°47062
croustx
Modoadorateur
Posté le 01-09-2026 à 10:42:24  profilanswer
 

oui :o
 
Mais là c'est pour un usage entreprise :o
 
On est en train de monter un projet, et on a besoin d'aller vite au produit.
 
L'idée :
. avoir un modèle pour que des users puissent coder en connectant VisualStudio au Spark
. avoir un agent qui mets de la cohérence sur le projet
. on aura aussi besoin d'entrainer notre propre modèle à terme

n°47064
Plam
Bear Metal
Posté le 01-09-2026 à 10:45:40  profilanswer
 

croustx a écrit :

oui :o
 
Mais là c'est pour un usage entreprise :o
 
On est en train de monter un projet, et on a besoin d'aller vite au produit.
 
L'idée :
. avoir un modèle pour que des users puissent coder en connectant VisualStudio au Spark
. avoir un agent qui mets de la cohérence sur le projet
. on aura aussi besoin d'entrainer notre propre modèle à terme


 
Le plus efficient que j'ai pu faire jusqu'à présent :

  • un programme métier qui va faire… du métier (fetcher des infos aux bons endroits etc.) avec une API/endpoints
  • un modèle OpenWebUI qui part d'un modèle classique (eg Qwen 27B) MAIS avec un prompt qui fait le lien entre les besoins utilisateurs et les endpoint du programme précédent. Pour ça, dans OpenWebUI, tu vas créer des "Tools".


Grace à ça, j'ai un agent « Vente », « Support Tech » etc. qui peuvent respectivement lire le CRM et trouver des patterns, lire des tickets et chercher de la doc, faire des PRs de doc etc.


---------------
Spécialiste du bear metal
n°47065
neo world
Posté le 01-09-2026 à 10:50:38  profilanswer
 

croustx a écrit :

oui :o
 
Mais là c'est pour un usage entreprise :o
 
On est en train de monter un projet, et on a besoin d'aller vite au produit.
 
L'idée :
. avoir un modèle pour que des users puissent coder en connectant VisualStudio au Spark
. avoir un agent qui mets de la cohérence sur le projet
. on aura aussi besoin d'entrainer notre propre modèle à terme


Tu peux y connecter trois dev en mode équipe du matin / journée / nuit. Confort :o
 
Pour tout le reste RTX 6000 pro AMHA

n°47066
croustx
Modoadorateur
Posté le 01-09-2026 à 10:53:02  profilanswer
 

et par qui sont appelés les agents ? Une IA de supervision, ou bien les utilisateurs en direct ?
 
... et pourquoi ne pas avoir une "grosse IA qui a accès à tout" ?

n°47067
Plam
Bear Metal
Posté le 01-09-2026 à 10:55:31  profilanswer
 

croustx a écrit :

et par qui sont appelés les agents ? Une IA de supervision, ou bien les utilisateurs en direct ?

 

... et pourquoi ne pas avoir une "grosse IA qui a accès à tout" ?

 

1. Dans l'interface de OpenWebUI, ils choisissent (ou configurent par défaut) l'agent avec qui ils bossent (ou font juste "@" pour en changer en cours de conversation). Puis ils posent les questions et ça répond à tout. Comme un ChatGPT mais qui connait la boîte sur sa partie métier et capable de faire des rapports/graphs et trouver des pattern en quelques secondes sur des tonnes de data.
2. Parce que t'es obligé de spécialiser, surtout déjà la taille du prompt par « spécialiste » (vente, vs support etc.). Le prompt est déjà assez gros, plus gros tu perdrais vraiment du contexte pour rien. Et ça c'est juste côté IA, parce qu'ensuite côté « accès à tout » ça pose question si tu commences à faire plus que de la lecture…


Message édité par Plam le 01-09-2026 à 10:56:07

---------------
Spécialiste du bear metal
n°47070
tfpsly
Sly
Posté le 01-09-2026 à 11:15:06  profilanswer
 

tfpsly a écrit :


Merci. Mais... pi.dev a du mal à debugger mon projet avec un contexte de 32k. Je suis obligé de monter à 45k, et n'avoir que 30tk/s, pour avoir un agent plus compétent. A explorer plus - peut-être un pb dans ma config de pi.dev, qui compresse le contexte trop vite ou mal... Mais je monte rapidement à 64% d'utilisation du contexte.


Finalement, il fallait juste installer deux extensions de pi.dev : pi-repetition-guard et pi-loop-police
 
Je peux même réduire la taille du contexte à 24k, mettre plus de layers en VRAM, et atteindre 42 tk/s (430 tk/s dans les phases de prompt processing).


Message édité par tfpsly le 01-09-2026 à 11:17:17
n°47071
moyen_moin​s
chat réincarné
Posté le 01-09-2026 à 11:20:24  profilanswer
 

the_fennec a écrit :


 
Le PP est pas top quand même, j’arrive péniblement a 50/s.


je me doutais qu'il y avait un hic quelque part :D

n°47073
speedboyz3​0
Guide Michelin :o
Posté le 01-09-2026 à 11:28:12  profilanswer
 

speedboyz30 a écrit :

Y a des M3 Ultra qui sont tombés sur le refurb. 96Go ram 820GB/s de bande passante pour 5200 euros.  
 
On perd un peu de bande passante et les neural accelerators mais ça positionne bien dans l’étalement de la gamme :jap:
Entre le M3 Max 64 Go et le M5 Ultra 96Go.
Voilà voilà :o


 
Ils sont partis  [:la chancla:1]

n°47076
Amonchakai
Posté le 01-09-2026 à 11:30:43  profilanswer
 

Vers chez toi? :o

n°47078
the_fennec
f3nn3cUs z3rd4
Posté le 01-09-2026 à 11:34:33  profilanswer
 

J'ai l'impression que mon Qwen Next a des doutes :o
 
https://i.imgur.com/C0PuylR.png
 
A priori c'est ce problème:
https://github.com/ggml-org/llama.cpp/pull/27941

Message cité 1 fois
Message édité par the_fennec le 01-09-2026 à 11:39:25

---------------
Faudra que je teste un jour :o
n°47079
moyen_moin​s
chat réincarné
Posté le 01-09-2026 à 11:37:52  profilanswer
 

ah oui, je crois qu'il est perdu dans ses pensées :o

n°47081
AllenMadis​on
Oracle du Keb's
Posté le 01-09-2026 à 12:00:52  profilanswer
 

the_fennec a écrit :

J'ai l'impression que mon Qwen Next a des doutes :o

 

https://i.imgur.com/C0PuylR.png

 

A priori c'est ce problème:
https://github.com/ggml-org/llama.cpp/pull/27941

 

Hmm hmm hmm.

 

https://i.imgur.com/VfzCWX5.png

 

https://i.imgur.com/aAB1eKF.png

 

Oui ton qwen pédale dans la semoule :o

Message cité 1 fois
Message édité par AllenMadison le 01-09-2026 à 12:15:52

---------------
Nothing much to teach, man. There's ze high, there's ze low and yall still fucking miss.
n°47084
the_fennec
f3nn3cUs z3rd4
Posté le 01-09-2026 à 12:17:33  profilanswer
 

AllenMadison a écrit :


 
Hmm hmm hmm.
 
Oui ton qwen pédale dans la semoule :o


 
Ben oui, c'est Qwen 4 en mode expérimental...


---------------
Faudra que je teste un jour :o
n°47087
neo world
Posté le 01-09-2026 à 13:11:28  profilanswer
 

neo world a écrit :

le contexte à 32000 tokens après 11 minutes d'échange. Ca engloutie des tokens plus vite que des tic tac :o
 
Si vous vous demandez quelle tâche hyper complexe je lui ait confié : se connecter à mon endpoint nextcloud talk et mettre en place un webhook en http simple pour récupérer les notifs / messages ...  :lol:
 
edit contexte de 66K tokens 32 minutes plus tard ... toujours pas de connection à Nextcloud en vue mais il bosse :o
Je vais p't'être finir par lui donner une solution moi même https://apps.nextcloud.com/apps/hermes_talk_bridge  
 
Mais merci pour le stress test sur un truc trivial :whistle:


Je ne vous ait pas donné l'épilogue : 2h50 plus tard il me dit que c'est fini et que je dois juste l'ajouter dans un chat pour lui parler ... ça marche nickel  :pt1cable:  
 
Du coup je lui ait demandé de mettre le code créé dans un repo git et d'écrire la doc pour que d'autres agents Hermes puissent reproduire le déploiement plus rapidement qu'en recréant le plugin de leur côté ... Il vient d'écrire la doc dans le readme.md ... pour se connecter à Git et pousser de la doc et du code  :whistle:
 
Contexte : 122k tokens pour ces deux tâches. Faudra que je regarde la partie compaction à un moment :D

Message cité 1 fois
Message édité par neo world le 01-09-2026 à 13:14:07
n°47088
AllenMadis​on
Oracle du Keb's
Posté le 01-09-2026 à 13:12:59  profilanswer
 

neo world a écrit :


Je ne vous ait pas donné l'épilogue : 2h50 plus tard il me dit que c'est fini et que je dois juste l'ajouter dans un chat pour lui parler ... ça marche nickel  :pt1cable:  
 
Du coup je lui ait demandé de mettre le code créé dans un repo git et d'écrire la doc pour que d'autres agents Hermes puissent reproduire le déploiement plus rapidement qu'en recréant le plugin de leur côté ... Il vient d'écrire la doc dans le readme.md ... pour se connecter à Git et pousser de la doc et du code  :whistle:


 
C'est fort une IA, hein ? :o


---------------
Nothing much to teach, man. There's ze high, there's ze low and yall still fucking miss.
n°47089
neo world
Posté le 01-09-2026 à 13:15:57  profilanswer
 

Il est un peu dans le futur : voici la doc à utiliser pour revenir dans le passé et pousser le code qu'on t'a demandé plus rapidement [:hide]

n°47090
speedboyz3​0
Guide Michelin :o
Posté le 01-09-2026 à 13:17:32  profilanswer
 

Amonchakai a écrit :

Vers chez toi? :o


 
Je ne suis plus là où j'étais :o
 
Mais non c'est revenu sur le store fr :jap:
 
Je suis vraiment partagé :o

n°47091
neo world
Posté le 01-09-2026 à 13:19:52  profilanswer
 

si je devais choisir le plus gros nombre de GB que de RAM et de stockage que je peux me permettre. A priori c'est plutôt chez M3 que chez M5 :jap:

n°47092
Neji Hyuga
:grut:
Posté le 01-09-2026 à 13:24:18  profilanswer
 
n°47093
speedboyz3​0
Guide Michelin :o
Posté le 01-09-2026 à 13:25:23  profilanswer
 
n°47094
neo world
Posté le 01-09-2026 à 13:28:28  profilanswer
 

pour nous impressionner faut encore les brancher :love:

n°47095
Neji Hyuga
:grut:
Posté le 01-09-2026 à 13:31:51  profilanswer
 

Celui du dessous l'est déjà, mais plus pour longtemps malheureusement :o


---------------
Le Topic Unique des collections de cartes graphiques - GPUCHAN.ORG
n°47099
speedboyz3​0
Guide Michelin :o
Posté le 01-09-2026 à 13:57:48  profilanswer
 

neo world a écrit :

si je devais choisir le plus gros nombre de GB que de RAM et de stockage que je peux me permettre. A priori c'est plutôt chez M3 que chez M5 :jap:


 
En gros la shortlist:  
 
M3 Ultra | CPU 28 cœurs et GPU 60 cœurs | 96Go Ram 820Go/s | 1To SSD: 5,200 @reconditionné
M5 Max | CPU 18 cœurs et GPU 40 cœurs | 128Go Ram 614Go/s | 1To SSD: 5,600 @edu
M5 Ultra | CPU 30 cœurs et GPU 64 cœurs | 96Go Ram 1.2TB/s | 1To SSD: 6,100 @edu
 
On peut pas tout avoir :o
 
Au final en terme de GPU perf, le M3 Ultra est presque au niveau du M5 Max.  
 
Plus de ram? M5 Max.
Un peu plus de bande passante mais moins de ram: M3 Ultra.
Encore plus de bande passante / buy once cry once / yolo / on n'est plus à 500 balles près quand on lâche 5k pour s'amuser: M5 Ultra.
 
L'idée c'est de servir 2 users en usage agentique avec un modèle type Qwen 3.8 27B Q6/Q8 en étant large sur le contexte :o

n°47105
neo world
Posté le 01-09-2026 à 14:21:43  profilanswer
 

Le M5 max semble un bon milieu dans ces conditions mais je suis plus sensible à la capacité qu'à la vitesse :jap:

n°47108
neo world
Posté le 01-09-2026 à 14:31:37  profilanswer
 

n'empêche gros coup de coeur pour Hermes : c'est rapide, verbeux juste ce qu'il faut, il récupère bien des erreurs. Que du positif vs openclaw :D

n°47109
the_fennec
f3nn3cUs z3rd4
Posté le 01-09-2026 à 14:40:02  profilanswer
 

AllenMadison a écrit :


 
C'est fort une IA, hein ? :o


 
Rien a voir, c'est OpenClaw qui est codé avec le cul.


---------------
Faudra que je teste un jour :o
n°47111
AllenMadis​on
Oracle du Keb's
Posté le 01-09-2026 à 15:01:32  profilanswer
 

Est-ce que quelqu'un ici a un serveur avec au moins 192 ou 320go de ram pour effectuer un calcul python et me rendre un petit service ? :o

 

En dessous c'est mort, et mes 32go de ram sur mon pc ça va pas suffire :o

 

Oui je sais que poser cette question là en pleine pénurie de ram... :o

 

Pour les curieux, je tente de calculer de l'entropie sur une absorption de positivité de signe des nombres premiers (forme de weil pour RH) via une construction par des matrices de hadamard. Pour 1024 et 2048 matrices ça me demande respectivement entre 80 et 120go de ram / 220/320go (sans optimisations). La VM de ChatGPT n'a que 32go de ram aussi donc ça coince un peu :o

Message cité 1 fois
Message édité par AllenMadison le 01-09-2026 à 15:13:42

---------------
Nothing much to teach, man. There's ze high, there's ze low and yall still fucking miss.
 Page :   1  2  3  4  5  ..  52  53  54  ..  56  57  58  59  60  61

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)