| |||||
| Auteur | Sujet : Infra IA : aide au choix et troubleshot de LLM Locaux |
|---|---|
the_fennec f3nn3cUs z3rd4 | Reprise du message précédent : --------------- Faudra que je teste un jour :o |
the_fennec f3nn3cUs z3rd4 | https://github.com/ggml-org/llama.cpp/pull/26012
--------------- Faudra que je teste un jour :o |
LaRoueEstTombee Hortense ! Pour moi ! | J'ai un peu avancé avec mon souci d'accès à une base de données avec un outil, pymysql est bien installé, les variables d'environnements pour la connexion à la base de données sont bien visible par Open WebUI, par contre, il semblerait qu'il y ait un souci de communication entre Open WebUI et Lemonade Server, il n'y aurait pas la prise en charge du Native Function Calling et il faudrait que je passe ça en Prompt Injection... J'ai testé quelques paramètres pour mais sans grande réussite. --------------- Votre couroux impitoiable Veut-il renverser l'Univers ? |
yohaskan |
Message cité 1 fois Message édité par yohaskan le 24-07-2026 à 10:45:40 |
Pipould's |
|
neo world | lequel rentre dans 9GO ? Parce qu'en IQ1 il fait 11GO et y'a pas le contexte encore Message cité 1 fois Message édité par neo world le 25-07-2026 à 12:28:09 |
Pipould's |
|
neo world | je suis un peu dubitatif après quelques tests : Qwen 3.5 remonte régulièrement comme avec de meilleures perfs que 3.6 https://www.fitmyllm.com/compare?mo [...] .5-35b-a3b
|
Pipould's |
|
neo world |
Pipould's |
|
the_fennec f3nn3cUs z3rd4 |
--------------- Faudra que je teste un jour :o |
neo world |
Message cité 2 fois Message édité par neo world le 25-07-2026 à 18:52:32 |
the_fennec f3nn3cUs z3rd4 |
--------------- Faudra que je teste un jour :o |
ibuprophet |
|
the_fennec f3nn3cUs z3rd4 | Un MoE dans 32GB de VRAM ya quand même moyen de faire des choses... --------------- Faudra que je teste un jour :o |
ibuprophet | Je ne dis pas mais un qwen3.6 (le seul potable sur 5090) se prend maintenant une bonne distance vs les derniers modèles moyen de gamme récents comme Sonnet 5, largement utilisable avec un forfait Claude pro à 15€. Et je ne parle pas des modèles chinois pour leques 15€ c'est quasi de l'illimité. Bref, le LLM local, à moins d'être une entreprise avec un paquet de pognon à mettre sur la table, ça perd de plus en plus de son intérêt vs le online. Sans parler du fait que les chinois ont arrêté de publier des petits modèles qui tournent en local. Toutes les sorties OW récentes sont quasi inaccessibles sur du matériel grand public.
|
neo world | plutôt d'accord en ce 26 Juillet mais :
|
Pipould's |
|
Nr13 | Ca me semble erronné de mettre deepseek/mistral/z.ai etc dans la même liste que gemini/chatgpt/claude.
Message édité par Nr13 le 26-07-2026 à 10:36:09 |
neo world | les skills et les MCP que tout le monde utilise viennent d'Anthropic, le modèle d'enpoint API d'OpenAI, gemini c'est aussi gemma et plus généralement les transformers. Le Open weight n'est pas la seule forme de contribution à l'effort général Message édité par neo world le 26-07-2026 à 10:46:05 |
Nr13 | Tu veux dire les standards? Car tout le monde développe et propose des skills/mcp.
|
ibuprophet | Pour asseoir mes propos : je viens de tester laguna S 2.1 sur mon serveur, la dernière recrue OW assez small pour tourner sur du matos grand public.
|
the_fennec f3nn3cUs z3rd4 | Pour du pro le rapport qualité/prix n'est pas rentable en local. La seule raison de faire tourner en local, c'est pour être sur que les données restent en local.
--------------- Faudra que je teste un jour :o |
Tronklou ❤❤ Vrp Bambulab à mi-temps ❤❤ | Clairement faut pas viser une quelconque rentabilités avec du local !
--------------- Victime de girafophobie, mais se soigne. |
XprtZ Profil : O.O | Mais ensuite est ce que l'IA est réellement nécessaire pour tout et n'importe quoi ? --------------- PSN : XprtZ - BattleTag : XprtZ#2257 - 3DS : 2492-4109-3060 |
the_fennec f3nn3cUs z3rd4 | Au taf' j'utilise l'IA pour faire les trucs qui me font chier, genre les tests. L'IA ajoute un gros coverage, j'ai juste a vérifier que les tests font ce qu'ils doivent faire.
--------------- Faudra que je teste un jour :o |
ibuprophet | Et encore, si tu t'en sers pour dev, à la rigueur ça a un intérêt. Quand on voit à quoi sert l'IA quand on ouvre les réseaux sociaux, il y a de quoi pleurer... |
Tronklou ❤❤ Vrp Bambulab à mi-temps ❤❤ |
--------------- Victime de girafophobie, mais se soigne. |
yohaskan | En local, niveau conso électrique je trouve qu'avoir un LLM très rapide en token/s type qwen3.6-35b-a3b-mtp à (120 T/s), plus confortable qu'un LLM plus performant mais plus lent (qwen3.6-27b à 70 T/s) , car sa réponse va faire travailler plus longtemps le GPU donc conso et chaleur en plus. Message édité par yohaskan le 26-07-2026 à 20:32:21 |
Plam Bear Metal | Ici (cf mes messages précédents) j'ai 3 GPUs (1x Ada, 1x Blackwell en RTX6000 plus une 5090 pour les tests) pour faire tourner plein plein de trucs pour la boîte pour lesquels les Qwen même en 27B suffisent largement. Un assistant des ventes qui a accès à toute l'historique des contacts, pareil pour le support tech, capacité à ouvrir des PRs pour la doc etc.
--------------- Spécialiste du bear metal |
the_fennec f3nn3cUs z3rd4 | Intéressant comme retour Plam Message cité 1 fois Message édité par the_fennec le 26-07-2026 à 19:37:37 --------------- Faudra que je teste un jour :o |
Plam Bear Metal |
J'utilise les modèles dans OpenWebUI : tu choisi un modèle de base (mon Qwen 35 MoE par exemple) et tu lui donnes ensuite un prompt spécifique. Tu peux ajouter des "tools" (script Python qui fait des calculs par exemple, perf sur un quarter de l'équipe vente) et le prompt va utiliser le tool. Le prompte est assez simple : t'es un assistant vente de la boite, tu as accès à ceci et cela (réference au tool python et ses endpoints). C'est vraiment trivial est ultra puissant, et illimité en terme de coût de tokens, en plus d'être rapide et de jamais faire sortir tes données maisons. Message cité 1 fois Message édité par Plam le 26-07-2026 à 20:18:01 --------------- Spécialiste du bear metal |
extenue1 |
|
the_fennec f3nn3cUs z3rd4 |
--------------- Faudra que je teste un jour :o |
croustx Modoadorateur | Vous avez une idée de prompt pour tester si un modèle est vraiment "décensuré' ?
|
Tronklou ❤❤ Vrp Bambulab à mi-temps ❤❤ | Fait lui traduire du nfsw, t'es fixé direct --------------- Victime de girafophobie, mais se soigne. |
Plam Bear Metal |
--------------- Spécialiste du bear metal |
the_fennec f3nn3cUs z3rd4 |
--------------- Faudra que je teste un jour :o |
croustx Modoadorateur | Bon, |

| Sujets relatifs | |
|---|---|
| [Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & co | sécurité de l'IA / agentique et des Devs en roue libre |
| Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux | |




