Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
3079 connectés 

 


Quel titre pour notre topic ?
Sondage à 8 choix possibles.
Ce sondage expirera le 15-08-2026 à 10:00




Attention si vous cliquez sur "voir les résultats" vous ne pourrez plus voter

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  26  27  28  29  30  31
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°43377
croustx
Modoadorateur
Posté le 27-07-2026 à 10:18:15  profilanswer
 

Reprise du message précédent :
Bon,  
 
* Openclaw : au bout de quelques jours, ils prenaient *beaucoup* de libertés, reconfigurant le PC host, jusqu'à le détruire :o
 
* Hermes : il ne prend pas assez de liberté :o il s'arrête au moindre blocage. Demande tout le temps mon avis.  
 
Faut que j'arrive à trouver un entre deux :o

n°43378
Olivie
SUUUUUUUUUUUUUU
Posté le 27-07-2026 à 10:23:34  profilanswer
 

croustx a écrit :

Bon,  
 
* Openclaw : au bout de quelques jours, ils prenaient *beaucoup* de libertés, reconfigurant le PC host, jusqu'à le détruire :o
 
* Hermes : il ne prend pas assez de liberté :o il s'arrête au moindre blocage. Demande tout le temps mon avis.  
 
Faut que j'arrive à trouver un entre deux :o


Demande lui de te trouver le topik OpenClaw/hermes pour qu’on en discute la bas :o
Ça fera un peu revivre le topik.


Message édité par Olivie le 27-07-2026 à 10:23:53

---------------

n°43381
the_fennec
f3nn3cUs z3rd4
Posté le 27-07-2026 à 10:48:52  profilanswer
 

croustx a écrit :

Bon,  
 
* Openclaw : au bout de quelques jours, ils prenaient *beaucoup* de libertés, reconfigurant le PC host, jusqu'à le détruire :o
 
* Hermes : il ne prend pas assez de liberté :o il s'arrête au moindre blocage. Demande tout le temps mon avis.  
 
Faut que j'arrive à trouver un entre deux :o


 
En LLM local ils arrivent a rien, ces trucs ne marchent que si t'as un gros modèle derrière.


---------------
Faudra que je teste un jour :o
n°43383
croustx
Modoadorateur
Posté le 27-07-2026 à 10:56:02  profilanswer
 

the_fennec a écrit :


 
En LLM local ils arrivent a rien, ces trucs ne marchent que si t'as un gros modèle derrière.


 
Concrètement, vous gérez ça comment ?
 
J'ai Qwen 3.6 en local.  
Comment je peux "l'aider" avec un gros modele en ligne, pour vraimement pas cher ? (genre gratuit :o )

n°43384
Olivie
SUUUUUUUUUUUUUU
Posté le 27-07-2026 à 10:57:51  profilanswer
 

croustx a écrit :


 
Concrètement, vous gérez ça comment ?
 
J'ai Qwen 3.6 en local.  
Comment je peux "l'aider" avec un gros modele en ligne, pour vraimement pas cher ? (genre gratuit :o )


Si tu demandais sur le topik OpenClaw certains te répondraient en gratuit sans doute Nvidia qui proposent certains modèles gratuits mais un peu lents.


---------------

n°43391
the_fennec
f3nn3cUs z3rd4
Posté le 27-07-2026 à 11:12:17  profilanswer
 

croustx a écrit :


 
Concrètement, vous gérez ça comment ?
 
J'ai Qwen 3.6 en local.  
Comment je peux "l'aider" avec un gros modele en ligne, pour vraimement pas cher ? (genre gratuit :o )


 
J'ai laissé tombé en local, OC est codé avec les pieds et bouffe tout le contexte juste pour dire bonjour. Hermes j'ai testé mais pas plus que ça, c'est le code qui m'intéresse.
 
C'est quoi ton modèle?

Message cité 1 fois
Message édité par the_fennec le 27-07-2026 à 11:43:37

---------------
Faudra que je teste un jour :o
n°43392
the_fennec
f3nn3cUs z3rd4
Posté le 27-07-2026 à 11:14:22  profilanswer
 

Running a 118B Model on 12GB VRAM. Better Qwen 35B?
https://youtu.be/NIxCj-3fFNk
 
Codacus teste Laguna sur sa 3060 12GB avec 64GB de RAM en plus :/. Il arrive a 12 tg/s ça marche mais pas parfait non plus.


---------------
Faudra que je teste un jour :o
n°43394
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 27-07-2026 à 11:29:59  profilanswer
 

croustx a écrit :

 

Concrètement, vous gérez ça comment ?

 

J'ai Qwen 3.6 en local.
Comment je peux "l'aider" avec un gros modele en ligne, pour vraimement pas cher ? (genre gratuit :o )

 


C'est mort.

 

Je switch entre codex et ollama pour Hermes.

 

Mais oublie d'avoir un agent pas cher si tu veux quelque chose d'efficace


---------------
Victime de girafophobie, mais se soigne.
n°43396
Nr13
Posté le 27-07-2026 à 11:46:38  profilanswer
 

des trucs comme minimax ou même dsv4-flash/mimo2.5 (non pro) c'est vraiment pas cher et ça me semble largement suffisant.

n°43397
croustx
Modoadorateur
Posté le 27-07-2026 à 12:45:15  profilanswer
 

the_fennec a écrit :


 
J'ai laissé tombé en local, OC est codé avec les pieds et bouffe tout le contexte juste pour dire bonjour. Hermes j'ai testé mais pas plus que ça, c'est le code qui m'intéresse.
 
C'est quoi ton modèle?


 
J'étais sur Qwen3.6-35B-A3B en MOE, mais je le trouve vraiment mauvais.
(ce qui est normal, car axée sur la vitesse)
 
Je vais basculer sur Qwen3.6-27B Q5_K_M

n°43398
the_fennec
f3nn3cUs z3rd4
Posté le 27-07-2026 à 13:42:50  profilanswer
 

Oui 27B est bien meilleur.


---------------
Faudra que je teste un jour :o
n°43399
croustx
Modoadorateur
Posté le 27-07-2026 à 14:11:38  profilanswer
 

ce qui est contre-intuitif :o
 

n°43400
the_fennec
f3nn3cUs z3rd4
Posté le 27-07-2026 à 14:21:35  profilanswer
 

Non c'est un modèle dense. Les 27B sont actifs tout le temps, le 35B n'a que 3B actifs a la fois. D'ou la différence de perf et "d'intelligence".


---------------
Faudra que je teste un jour :o
n°43401
ibuprophet
Posté le 27-07-2026 à 14:52:47  profilanswer
 

Quant au bien meilleur, je nuancerais sur la base de mes tests. Il est un peu meilleur. Faut pas s'attendre à un gpt-5.6 luna non plus

n°43402
neo world
Posté le 27-07-2026 à 15:02:29  profilanswer
 

croustx a écrit :

ce qui est contre-intuitif :o
 


en fait le 35B fait passer chaque token sur 3Milliards de paramètres (le A3B à la fin) le 27B fait passer chaque token dans chaque paramètre (oui 27 milliards. C'est l'équivalent en terme d'optimisation à un brute force :o)
 
Le vrai miracle c'est que le mixture of experts tienne quand même bien la route en terme de qualité en plus de sa rapidité :D


Message édité par neo world le 27-07-2026 à 15:03:38
n°43403
the_fennec
f3nn3cUs z3rd4
Posté le 27-07-2026 à 15:39:45  profilanswer
 

Info alacon du jour: si vous avec ROCm d'installé il se prends un petit GB de VRAM même si on l'utilise pas :/  
C'est pas super clair pour moi mais, j'avais ROCm sur le premier et pas sur le second:

Code :
  1. [34m0.15.342.879[0m [32mI [0mllama_prepare_model_devices: using device RPC0 (host0:50000) (unknown id) - 15213 MiB free
  2. [34m0.15.364.147[0m [32mI [0mllama_prepare_model_devices: using device RPC1 (host1:50000) (unknown id) - 16878 MiB free


 
Un fois viré, j'ai bien "16878 MiB free" sur les deux.


---------------
Faudra que je teste un jour :o
n°43404
Plam
Bear Metal
Posté le 27-07-2026 à 15:44:14  profilanswer
 

Je confirme : 35B MoE A3B est très bien pour des questions à la con du quotidien. Dès que tu as besoin de plus de contexte car ça devient plus que juste résumer ou traduire mais « interpréter », alors 27B dense est vraiment au dessus.


---------------
Spécialiste du bear metal
n°43405
neo world
Posté le 27-07-2026 à 15:47:42  profilanswer
 

the_fennec a écrit :

Info alacon du jour: si vous avec ROCm d'installé il se prends un petit GB de VRAM même si on l'utilise pas :/  
C'est pas super clair pour moi mais, j'avais ROCm sur le premier et pas sur le second:

Code :
  1. [34m0.15.342.879[0m [32mI [0mllama_prepare_model_devices: using device RPC0 (host0:50000) (unknown id) - 15213 MiB free
  2. [34m0.15.364.147[0m [32mI [0mllama_prepare_model_devices: using device RPC1 (host1:50000) (unknown id) - 16878 MiB free


 
Un fois viré, j'ai bien "16878 MiB free" sur les deux.


 
 
tu as fais un top avant de le killer pour voir ce qu'il consommait vu du kernel ?  
 
En théorie il ne doit pas résider en vram si il ne se passe rien (en théorie seulement :o ) mais ce serait pas déconnant que le framework chargé en RAM te bouffe le GB (pas de chance c'est de la mémoire unifiée chez toi)
 
si tu n'utilises pas rocm ne te prend pas la tête sinon tu as les paramètres --lowvram et --disable-pinned-memory qui pourraient aider mais je ne les ait pas testé. https://rocm.docs.amd.com/projects/ [...] nsryz.html

Message cité 1 fois
Message édité par neo world le 27-07-2026 à 15:48:25
n°43406
the_fennec
f3nn3cUs z3rd4
Posté le 27-07-2026 à 16:10:38  profilanswer
 

J'ai réussi a charger Laguna en UD-IQ4_XS, c'est juste un peu leeennnnt 4/5 tgs
 
Le Flappy bird est un chouilla dur:
https://sia-cliff-ex5t.pagedrop.io


---------------
Faudra que je teste un jour :o
n°43407
the_fennec
f3nn3cUs z3rd4
Posté le 27-07-2026 à 16:11:53  profilanswer
 

neo world a écrit :


tu as fais un top avant de le killer pour voir ce qu'il consommait vu du kernel ?  
 
En théorie il ne doit pas résider en vram si il ne se passe rien (en théorie seulement :o ) mais ce serait pas déconnant que le framework chargé en RAM te bouffe le GB (pas de chance c'est de la mémoire unifiée chez toi)
 
si tu n'utilises pas rocm ne te prend pas la tête sinon tu as les paramètres --lowvram et --disable-pinned-memory qui pourraient aider mais je ne les ait pas testé. https://rocm.docs.amd.com/projects/ [...] nsryz.html


 
C'est sur une BC250, donc RAM=VRAM :D
J'ai pas besoin de ROCm c'était pour tester VLLM, mais il marchait pas de toute manière.


---------------
Faudra que je teste un jour :o
n°43408
neo world
Posté le 27-07-2026 à 16:17:07  profilanswer
 

the_fennec a écrit :

J'ai réussi a charger Laguna en UD-IQ4_XS, c'est juste un peu leeennnnt 4/5 tgs
 
Le Flappy bird est un chouilla dur:
https://sia-cliff-ex5t.pagedrop.io


le mot que tu cherches c'est "injouable" tellement les piliers sont proches. C'est du base jump son truc :o

n°43409
croustx
Modoadorateur
Posté le 27-07-2026 à 16:24:59  profilanswer
 

the_fennec a écrit :

J'ai réussi a charger Laguna en UD-IQ4_XS, c'est juste un peu leeennnnt 4/5 tgs
 
Le Flappy bird est un chouilla dur:
https://sia-cliff-ex5t.pagedrop.io


 
Tu n'as pas essayé Qwen sur ta BC ?

n°43410
LaRoueEstT​ombee
Hortense ! Pour moi !
Posté le 27-07-2026 à 16:46:15  profilanswer
 

the_fennec a écrit :

J'ai réussi a charger Laguna en UD-IQ4_XS, c'est juste un peu leeennnnt 4/5 tgs
 
Le Flappy bird est un chouilla dur:
https://sia-cliff-ex5t.pagedrop.io


Avec ou sans les roues  :??:  

Spoiler :

[:r3g]


---------------
Votre couroux impitoiable Veut-il renverser l'Univers ?
n°43411
the_fennec
f3nn3cUs z3rd4
Posté le 27-07-2026 à 16:50:31  profilanswer
 

neo world a écrit :

le mot que tu cherches c'est "injouable" tellement les piliers sont proches. C'est du base jump son truc :o


C'est quand même dingue que Qwen soit le maître des petits modèles depuis si longtemps... Après c'est vrai que ça rapporte que de l'estime aux boites...
 

croustx a écrit :

Tu n'as pas essayé Qwen sur ta BC ?


Je suis entre Qwen3.6-27B-UD-Q8_K_XL_MTP et Qwen3.6-35B-A3B-UD-Q8_K_XL_MTP avec une préférence pour le 27B même si il est méga lent en PP avec 256K de contexte.
 
27B toujours au top:
https://blazing-moon-twfe.pagedrop.io/

Message cité 1 fois
Message édité par the_fennec le 27-07-2026 à 17:39:27

---------------
Faudra que je teste un jour :o
n°43414
the_fennec
f3nn3cUs z3rd4
Posté le 27-07-2026 à 17:18:58  profilanswer
 

K3 dispo:
https://huggingface.co/moonshotai/Kimi-K3
 
Mais j'ai pas 1.7TB de libre pour le DL ... je vais attendre les Q0 :o


---------------
Faudra que je teste un jour :o
n°43418
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 27-07-2026 à 18:16:53  profilanswer
 

Y a pas des Q négatifs ? C'est pour un amis :O
 
Je croise les doigts pour qwen 3.8 :')


---------------
Victime de girafophobie, mais se soigne.
n°43429
neo world
Posté le 27-07-2026 à 19:33:28  profilanswer
 

le seul truc qui sera négatif si le modèle tourne en GPU local c'est le compte en banque :o

n°43432
XaTriX
Posté le 27-07-2026 à 19:43:17  profilanswer
 

Le WAF aussi :o


---------------
[:dawa]
n°43440
neo world
Posté le 27-07-2026 à 20:10:35  profilanswer
 

oui là je pense qu'elle préférera encore apprendre que c'était dépensé en jeux, p**e et c**e que pour héberger un truc accessible gratuitement sur le web :o
https://www.kimi.com/resources/kimi-k3-pricing
 
"mais mimine si tu voyais les yeux des copains quand je leur ait dit que j'avais kimi K3 dans mon homelab"  [:el kiwi:5]


Message édité par neo world le 27-07-2026 à 20:11:49
n°43456
Olivie
SUUUUUUUUUUUUUU
Posté le 27-07-2026 à 22:04:48  profilanswer
 

Ça avance :o
 
https://img3.super-h.fr/images/2026/07/27/snapshot_4878463353548702303.jpg


---------------

n°43458
croustx
Modoadorateur
Posté le 27-07-2026 à 22:46:21  profilanswer
 


 

the_fennec a écrit :


Je suis entre Qwen3.6-27B-UD-Q8_K_XL_MTP et Qwen3.6-35B-A3B-UD-Q8_K_XL_MTP avec une préférence pour le 27B même si il est méga lent en PP avec 256K de contexte.
 
27B toujours au top:
https://blazing-moon-twfe.pagedrop.io/


 
Mais j'ai pas saisi : tu le faire tourner sur les deux BC ?
Tu as combien de token/s ?

n°43468
neo world
Posté le 28-07-2026 à 02:17:20  profilanswer
 


moi qui attend la version colibri à 10 tokens/s(semaine) :o
 [:so-saugrenu24:9]

n°43472
Olivie
SUUUUUUUUUUUUUU
Posté le 28-07-2026 à 06:56:40  profilanswer
 

https://pbs.twimg.com/media/HOQy941bwAAjGTH?format=png&name=small


---------------

n°43492
the_fennec
f3nn3cUs z3rd4
Posté le 28-07-2026 à 10:39:19  profilanswer
 

croustx a écrit :

Mais j'ai pas saisi : tu le faire tourner sur les deux BC ?
Tu as combien de token/s ?


 
J'ai une 4060Ti 16GB + 32GB RAM sous Windows + 2x BC250 sous Debian.
 
Je suis dans les 90 t/s en PP et 10/15 tg/s
J'espère que passer le réseau en 2.5gbs va booster un peu mon PP.


Message édité par the_fennec le 28-07-2026 à 10:41:46

---------------
Faudra que je teste un jour :o
n°43515
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 28-07-2026 à 13:37:20  profilanswer
 

C'est pas la latence qui ralentie la vitesse ? plus que le debit max ethernet ?


---------------
Victime de girafophobie, mais se soigne.
n°43517
the_fennec
f3nn3cUs z3rd4
Posté le 28-07-2026 à 14:05:10  profilanswer
 

Tronklou a écrit :

C'est pas la latence qui ralentie la vitesse ? plus que le debit max ethernet ?


C'est ce que je me disais aussi, mais sur certaines chaînes YT ils disent que ça aide. De toute manière ça aidera pour le chargement de modèle. Pour 2x 10 balles ça se tente.


---------------
Faudra que je teste un jour :o
n°43519
neo world
Posté le 28-07-2026 à 14:24:28  profilanswer
 

Les latences sont vraiment plus impactantes. Idéalement il faut du RDMA (idéalement directement au cul du GPU) pour se rapprocher de la scalabilité linéaire. Bon la il avait 1gb/s ou 120mo/s par grand vent. C’était aussi un facteur limitant :o

n°43522
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 28-07-2026 à 14:37:00  profilanswer
 

Tu nous fera un retour, c'est dans le panier amazon si jamais ca fonctionne mieux :D
Un moment je me posais la question de virer le nvme pour y coller un adaptateur sfp pcie et lancer le boot via le reseau et une clés usb.


Message édité par Tronklou le 28-07-2026 à 14:38:03

---------------
Victime de girafophobie, mais se soigne.
n°43523
M300A
Posté le 28-07-2026 à 14:53:14  profilanswer
 

Les 4 RTX 6k sont en cours de livraison, mais je vais avoir besoin de pièces en plus je pense.

 

Je commence par un DS4 Flash full ? Ca vaut le coup de tester autre chose comme un Qwen 3.5 400b compressé ? J'aurais aussi 512G de ddr5, ça vaudrait quand même le coup d'essayer un GML-5.2 ou c'est une perte de temps et je reporte ça si j'arrive à avoir 4 cartes de plus ?

 

:jap:


---------------
:wq
n°43524
the_fennec
f3nn3cUs z3rd4
Posté le 28-07-2026 à 15:02:36  profilanswer
 

J'ai pas mal de changement prévus:
 
- Alim 850W pour remplacer la 650W
- Passer la RTX 4060Ti sur une VM Debian avec 32GB de RAM
- Install d'une carte 10gbs
- Install d'un switch 10gbs / 2.5gbs + uplink box Orange
- Install d'une 1650 Super 4gb sur la VM windows (qui a la 4060Ti) avec ça: https://www.amazon.fr/dp/B0721M5S8Y
- Passage des BC250 en 2.5gbs + https://www.amazon.fr/dp/B0GQLZG93F
 
Le point un peu bloquant c'est que j'ai que 48GB de RAM sur mon server, donc ça va être serré :/


---------------
Faudra que je teste un jour :o
n°43532
Plam
Bear Metal
Posté le 28-07-2026 à 16:24:13  profilanswer
 

M300A a écrit :

Les 4 RTX 6k sont en cours de livraison, mais je vais avoir besoin de pièces en plus je pense.
 
Je commence par un DS4 Flash full ? Ca vaut le coup de tester autre chose comme un Qwen 3.5 400b compressé ? J'aurais aussi 512G de ddr5, ça vaudrait quand même le coup d'essayer un GML-5.2 ou c'est une perte de temps et je reporte ça si j'arrive à avoir 4 cartes de plus ?
 
:jap:


 
Ada ou Blackwell ? Parce que ça fait une belle diff de VRAM dispo.


---------------
Spécialiste du bear metal
 Page :   1  2  3  4  5  ..  26  27  28  29  30  31

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)