Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
4414 connectés 

 


Quel titre pour notre topic ?
Sondage à 8 choix possibles.
Ce sondage expirera le 15-08-2026 à 10:00




Attention si vous cliquez sur "voir les résultats" vous ne pourrez plus voter

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  27  28  29  30  31  32
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°43950
Nr13
Posté le 02-08-2026 à 12:48:02  profilanswer
 

Reprise du message précédent :
Merci pour les infos sur litellm, ça pourrait correspondre.
 
Concernant claude vs opencode, ça se discute manifestement, déjà apparemment claude bloat énormement niveau contexte et consommation de tokens.
 
Ex avec ds-flash justement (mais l'ancienne version) https://nqawhc.github.io/articles/h [...] t-quality/

n°43963
M300A
Posté le 02-08-2026 à 19:26:28  profilanswer
 

Plam a écrit :

 

Ta des éléments de comparaison eg par rapport à un Claude ?

 

Souvent on dit que le harness y fait aussi pour beaucoup, OpenCode est pas encore au niveau d'un Claude Code me dit on.

 

Bah franchement pour le moment niveau intelligence ça m'a l'air assez proche (je reste 100% convaincu qu'antropic bride les modèles car ils sont surchargés donc la plupart du temps tu peux foutre sur max c'est pas pris en compte), par contre c'est 10x mieux niveau réactivité.

 

Pour l'instant je me suis beaucoup servi avec OpenCode et je suis ravi, j'ai pris un peu de temps pour me bricoler un launcher de VSCode avec des variables d'environnement pour utiliser le plugin Claude Code sur cette instance, ça fonctionne maintenant, comme ca je peux lancer un VSCode ou l'autre et faire la même tâche en double aveugle :o

 

J'ai encore collé un openweb-ui mais je vais m'arrêter là pour le moment, j'aimerais bcp avoir une gestion propre de l'auth avec des métriques par users et des clefs d'api pour les codeurs, à priori je devrais commencer par un keycloack branché sur l'AD on permises... Plus la fois la :D
Si quelqu'un a un peu d'expérience la dessus... On a pas vocation à devenir fournisseur de service mais je sais bien comment ça va tourner donc j'anticipe :o on a déjà prévu de l'ouvrir à certains fournisseurs pour qu'ils essayent de corriger leur code de merde  [:oilrig]


Message édité par M300A le 02-08-2026 à 19:27:54

---------------
:wq
n°43964
Plam
Bear Metal
Posté le 02-08-2026 à 19:34:27  profilanswer
 

LiteLLM pour le metering c'est pas mal, j'utilise OpenWebUI juste pour les « end users ». Les devs veut directement le clef et donc branche LiteLLM à ton SSO et voilà.

 

edit : et merci pour les retours, je t'avoue que j'ai très envie de tester un gros GLM ou un Laguna avec 1M de contexte pour peut être remplacer Claude, mais le budget est franchement gros : si ça prend pas ça va être relou à justifier [:ddr555] (bon on peut toujours revendre derrière hein :o )


Message édité par Plam le 02-08-2026 à 19:35:15

---------------
Spécialiste du bear metal
n°43965
M300A
Posté le 02-08-2026 à 19:55:15  profilanswer
 

Au passage je suis en 1M sur ds4, inutile au quotidien mais c'est cool pour auditer des apps, et vu qu'il me reste plein de vram...


---------------
:wq
n°43966
Plam
Bear Metal
Posté le 02-08-2026 à 20:17:43  profilanswer
 

Du coup entre DeepSeek V4 flash 284B / GLM / Laguna ta une préf ?


---------------
Spécialiste du bear metal
n°43969
Olivie
SUUUUUUUUUUUUUU
Posté le 02-08-2026 à 21:31:27  profilanswer
 

Citation :

@HuggingModels
 
Ever wanted a massive AI model that fits on your laptop? Meet DeepSeek V4 Flash, a Mixture of Experts text generator, now in GGUF format. It's quantized down to 2-bit and 4-bit, making it super accessible. This is a game changer for local AI enthusiasts! #AI #DeepSeek
 
https://pbs.twimg.com/media/HOtW7BbagAAkqaT?format=jpg&name=small


https://huggingface.co/ox-ox/DeepSe [...] 1-gguf-ds4


---------------

n°43978
M300A
Posté le 02-08-2026 à 22:06:18  profilanswer
 

Plam a écrit :

Du coup entre DeepSeek V4 flash 284B / GLM / Laguna ta une préf ?

 

Laguna j'ai pas essayé. GLM-5.2 j'aime beaucoup mais c'est pas le même budget, en dessous de 8 RTX tu peux oublier.
La ou par contre DS plie le modèle-jeu c'est la release 0731. Avant DS4 Flash c'était sympa mais gaffeur je mettais quand même très en dessous de GLM mais cette nouvelle version... Pour moi c'est au niveau, en moins de moitié moins de matos...

Message cité 1 fois
Message édité par M300A le 02-08-2026 à 22:06:48

---------------
:wq
n°43983
Plam
Bear Metal
Posté le 02-08-2026 à 22:38:46  profilanswer
 

M300A a écrit :


 
Laguna j'ai pas essayé. GLM-5.2 j'aime beaucoup mais c'est pas le même budget, en dessous de 8 RTX tu peux oublier.
La ou par contre DS plie le modèle-jeu c'est la release 0731. Avant DS4 Flash c'était sympa mais gaffeur je mettais quand même très en dessous de GLM mais cette nouvelle version... Pour moi c'est au niveau, en moins de moitié moins de matos...


 
Si t'a l'occas de tester Laguna je suis preneur de ton retour :jap: DS flash 0731 m'a l'air en effet super intéressant :jap:


---------------
Spécialiste du bear metal
n°43986
the_fennec
f3nn3cUs z3rd4
Posté le 02-08-2026 à 23:14:32  profilanswer
 

Laguna j'ai testé ya quelques posts, c'est tout pourris, en dessous de Qwen 35B ou 27B.


---------------
Faudra que je teste un jour :o
n°44006
Olivie
SUUUUUUUUUUUUUU
Posté le 03-08-2026 à 11:17:10  profilanswer
 

Citation :

@Alibaba_Qwen
Meet Qwen3.8-Max — our most capable model to date.  
 
Next week, the open weights of Qwen3.8-Max will be released, and Qwen3.8-27B is also going open-weights to meet you all!


---------------

n°44007
neo world
Posté le 03-08-2026 à 11:50:36  profilanswer
 

[:cerveau dawa2]

n°44015
ibuprophet
Posté le 03-08-2026 à 13:12:29  profilanswer
 

Agréablement surpris, je n'y croyais plus

n°44018
M300A
Posté le 03-08-2026 à 13:47:54  profilanswer
 

Bon par contre je vais pas avoir que ça a faire moi :o
Je vais rester sur DS4 pour le moment


---------------
:wq
n°44020
the_fennec
f3nn3cUs z3rd4
Posté le 03-08-2026 à 14:19:02  profilanswer
 

Qwen3.8-Max ? C'est la première fois qu'ils publient leur gros modèle non?
J'espère qu'il y aura 35B aussi plus tard.


---------------
Faudra que je teste un jour :o
n°44025
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 03-08-2026 à 16:27:28  profilanswer
 

Olivie a écrit :

Citation :

@Alibaba_Qwen
Meet Qwen3.8-Max — our most capable model to date.  
 
Next week, the open weights of Qwen3.8-Max will be released, and Qwen3.8-27B is also going open-weights to meet you all!



 
 
[:dr_doak][:dr_doak][:dr_doak][:dr_doak][:dr_doak][:dr_doak][:dr_doak][:dr_doak][:dr_doak][:dr_doak][:dr_doak][:dr_doak][:dr_doak][:dr_doak][:dr_doak][:dr_doak][:dr_doak][:dr_doak][:dr_doak][:dr_doak][:dr_doak]


---------------
Victime de girafophobie, mais se soigne.
n°44029
Plam
Bear Metal
Posté le 03-08-2026 à 17:18:26  profilanswer
 

Oui, je suis curieux du gap potentiel entre 3.6 27B vs le nouveau en 3.8, vu que ça sera les même ressources derrières :jap: J'attend avec impatience sur les RTX 6000 :o


---------------
Spécialiste du bear metal
n°44031
M300A
Posté le 03-08-2026 à 19:16:25  profilanswer
 

Si vous voulez je teste tout ça pour vous, il me faut 50k juste pour rajouter 4 RTX, le châssis en prend 8 :o


---------------
:wq
n°44032
Plam
Bear Metal
Posté le 03-08-2026 à 19:28:25  profilanswer
 

M300A a écrit :

Si vous voulez je teste tout ça pour vous, il me faut 50k juste pour rajouter 4 RTX, le châssis en prend 8 :o


 
T'es parti sur quel chassis d'ailleurs ?


---------------
Spécialiste du bear metal
n°44034
Plam
Bear Metal
Posté le 03-08-2026 à 19:34:26  profilanswer
 

Putain la RTX que j'ai acheté 8k fin mai est déjà presque au double moins de 3 mois après… https://www.grafikkarten.com/fr/NVI [...] ulk/A18607


---------------
Spécialiste du bear metal
n°44036
ibuprophet
Posté le 03-08-2026 à 19:50:06  profilanswer
 

J'ai une RTX 5090 à vendre 4000€ pour ceux qui veulent anticiper la sortie de qwen3.8-27B  :o

n°44038
M300A
Posté le 03-08-2026 à 19:58:25  profilanswer
 

Plam a écrit :

 

T'es parti sur quel chassis d'ailleurs ?

 

C'est un revendeur allemand et le châssis c'est un machin Asus. En vrai je l'ai jamais vu mais je vais faire un saut sur place à l'occase.


---------------
:wq
n°44039
neo world
Posté le 03-08-2026 à 20:04:24  profilanswer
 

M300A a écrit :


 
C'est un revendeur allemand et le châssis c'est un machin Asus. En vrai je l'ai jamais vu mais je vais faire un saut sur place à l'occase.


on veut une photo #hardware porn :o

n°44041
M300A
Posté le 03-08-2026 à 20:19:21  profilanswer
 

neo world a écrit :


on veut une photo #hardware porn :o

 

Tu verrais une sacrée quantité d'Alcatel :o
Mais ça on va me faire chier mais des photos du châssis seul c'est faisable


---------------
:wq
n°44072
the_fennec
f3nn3cUs z3rd4
Posté le 04-08-2026 à 11:44:04  profilanswer
 

Plam a écrit :

Oui, je suis curieux du gap potentiel entre 3.6 27B vs le nouveau en 3.8, vu que ça sera les même ressources derrières :jap:


 
Je m'attends pas à grand-chose, les gars qui ont fait Qwen 3.5 sont partis...


---------------
Faudra que je teste un jour :o
n°44073
neo world
Posté le 04-08-2026 à 11:48:34  profilanswer
 

Ils vont quand même pas faire une annonce pour ensuite sortir une bouse :o

n°44076
the_fennec
f3nn3cUs z3rd4
Posté le 04-08-2026 à 11:53:59  profilanswer
 

Non, ça serait une première dans le monde des modèles open weight :o


---------------
Faudra que je teste un jour :o
n°44077
M300A
Posté le 04-08-2026 à 11:55:58  profilanswer
 

neo world a écrit :

Ils vont quand même pas faire une annonce pour ensuite sortir une bouse :o

 

[:leglatin:2]


---------------
:wq
n°44080
M300A
Posté le 04-08-2026 à 12:05:40  profilanswer
 

Plus sérieusement, de toute façon tout ce qui va sortir sera ridicule par rapport au nouveau DS4 Flash. Ça sera quelques pouillemes mieux en demandant, 2, 3 ou 4x de ressources  [:chevreuil_npa:3]


---------------
:wq
n°44081
the_fennec
f3nn3cUs z3rd4
Posté le 04-08-2026 à 12:05:58  profilanswer
 


 
Google
Mistral
Laguna
Longcat
Nemotron
Microsoft


---------------
Faudra que je teste un jour :o
n°44082
the_fennec
f3nn3cUs z3rd4
Posté le 04-08-2026 à 12:06:39  profilanswer
 

M300A a écrit :

Plus sérieusement, de toute façon tout ce qui va sortir sera ridicule par rapport au nouveau DS4 Flash. Ça sera quelques pouillemes mieux en demandant, 2, 3 ou 4x de ressources  [:chevreuil_npa:3]


 
Qwen 27B et DS4 c'est pas comparable...


---------------
Faudra que je teste un jour :o
n°44102
Pipould's
Posté le 04-08-2026 à 19:58:57  profilanswer
 

the_fennec a écrit :

 

Qwen 27B et DS4 c'est pas comparable...

 

Franchement sur des tâches spécialisées le 27b fait très bien le taff.

n°44103
M300A
Posté le 04-08-2026 à 20:02:24  profilanswer
 

Si je m'emmerde je regarderai si je peux le charger à côté de DS4 Flash mais j'ai peur que ça me force à faire des compromis sur la taille du contexte où les utilisateurs simultanés, pas sur que ça soit une bonne idée


---------------
:wq
n°44106
the_fennec
f3nn3cUs z3rd4
Posté le 04-08-2026 à 21:01:22  profilanswer
 

Pipould's a écrit :


 
Franchement sur des tâches spécialisées le 27b fait très bien le taff.


 
Le 27B est très bon pour sa taille, le 35B aussi, mais DS4 a 10x plus de paramètres quand même. Après j'ai pas testé DS4 ... :o


---------------
Faudra que je teste un jour :o
n°44107
Pipould's
Posté le 04-08-2026 à 21:02:54  profilanswer
 

the_fennec a écrit :


 
Le 27B est très bon pour sa taille, le 35B aussi, mais DS4 a 10x plus de paramètres quand même. Après j'ai pas testé DS4 ... :o


 
De maniere realiste, en dessous de combien de tps en pp et gen vous considerez le modele comme "inutilisable" ?  
 
Perso en dessous de 500/30 ca commence a etre tendu...

n°44108
ibuprophet
Posté le 04-08-2026 à 21:06:15  profilanswer
 

3000/80

n°44110
the_fennec
f3nn3cUs z3rd4
Posté le 04-08-2026 à 21:26:34  profilanswer
 

Perso, 100/7 mais c'est parceque je lance un prompt et je le laisse tourner la nuit voire des jours...


---------------
Faudra que je teste un jour :o
n°44111
neo world
Posté le 04-08-2026 à 21:33:07  profilanswer
 

the_fennec a écrit :

Perso, 100/7 mais c'est parceque je lance un prompt et je le laisse tourner la nuit voire des jours...


+1

n°44112
Pipould's
Posté le 04-08-2026 à 21:38:47  profilanswer
 

the_fennec a écrit :

Perso, 100/7 mais c'est parceque je lance un prompt et je le laisse tourner la nuit voire des jours...


 
Et t'arrives a quelque chose avec ca ? En utilisant quel harness ?

n°44116
the_fennec
f3nn3cUs z3rd4
Posté le 04-08-2026 à 22:59:35  profilanswer
 

Pipould's a écrit :

Et t'arrives a quelque chose avec ca ? En utilisant quel harness ?


 
Utile, je sais pas, fun oui :D. Pour le moment je joue avec des modèles et les harness en faisant un port de Linux 7.x pour mon Amiga 500. C'est presque impossible, mais ça me permet de tester avec des prompts qui bossent pendant longtemps tout seul, jusqu’à plus de 2 jours.
 
Coté harness, j'en ai testé des paquets... Dans ce que j'ai utilisé le plus, j'ai commencé sur Opencode, puis passé sur Claude-code mais la je viens de passer sur little-coder que je trouve pas mal.


---------------
Faudra que je teste un jour :o
n°44117
Pipould's
Posté le 05-08-2026 à 00:07:19  profilanswer
 

the_fennec a écrit :

 

Utile, je sais pas, fun oui :D. Pour le moment je joue avec des modèles et les harness en faisant un port de Linux 7.x pour mon Amiga 500. C'est presque impossible, mais ça me permet de tester avec des prompts qui bossent pendant longtemps tout seul, jusqu’à plus de 2 jours.

 

Coté harness, j'en ai testé des paquets... Dans ce que j'ai utilisé le plus, j'ai commencé sur Opencode, puis passé sur Claude-code mais la je viens de passer sur little-coder que je trouve pas mal.

 

Hmmmmmm je vois. Je suppose que ça pourrait être utile avec du crewai ou autre...

 

Mais pour moi en dessous de 500/30, j'ai vraiment du mal...

n°44118
neo world
Posté le 05-08-2026 à 00:11:35  profilanswer
 

tu as du mal parce que tu as des deadlines à tenir ou tu es pressé. Perso ça fait 5 mois que je rebuild mon homelab (trois grosses itérations avec des amélioration entre chaque)
 
C'est un plaisir que je n'aurais jamais pris si j'avais le début d'une deadline (d'ailleurs je m'en trouve tout seul histoire que ça ne tombe pas en désuétude)  
 
Si tout va bien je ferais une photo hardware porn / software porn d'ici la semaine prochaine. Si j'y arrive pas je sais pas si ça sera prêt vraiment un jour avec le départ en vacances de l'assistante maternelle :o

 Page :   1  2  3  4  5  ..  27  28  29  30  31  32

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)