Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
5953 connectés 

 


Quel titre pour notre topic ?
Sondage à 8 choix possibles.
Ce sondage expirera le 15-08-2026 à 10:00




Attention si vous cliquez sur "voir les résultats" vous ne pourrez plus voter

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  26  27  28  29  30  31
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°43020
the_fennec
f3nn3cUs z3rd4
Posté le 23-07-2026 à 17:20:26  profilanswer
 

Reprise du message précédent :
Qwen 3.6 14B A3B FableVibes benchmarked and tested vs Base Qwen 35B - 16GB Local LLM setup
https://www.youtube.com/watch?v=DBEd5dpxaNQ
https://huggingface.co/tvall43/Qwen [...] Vibes-GGUF
 
Intéressant, un Qwen 35B tronqué de 21B de paramètres qui tient dans 16GB pour Q8 et 9GB pour Q4_K_M, et comme c'est un MoE ça doit même tenir dans 8GB!
 
TL;DR: bon pour de l'agentique, bof pour le code.


---------------
Faudra que je teste un jour :o
n°43021
the_fennec
f3nn3cUs z3rd4
Posté le 23-07-2026 à 17:52:05  profilanswer
 

https://github.com/ggml-org/llama.cpp/pull/26012

Citation :

Historically, fully / predominantly AI-generated PRs are prohibited because most of them were noisy and non-functioning. However with the advancement of new frontier models, AI-generated code become more and more accurate & useful, and we started to see good quality fully AI-generated PRs from contributors and maintainers.
 
This updated AI usage policy now shift the requirements to the feature and contribution quality. Since writing code is much cheaper now, understanding & transparency matter more.
 
What does this mean to contributors?
 
    You are still 100% responsible for every line of code - slop PRs (especially non-working one) and/or fully-generated PR descriptions/messages will be rejected without questions
    For feature requests, open an issue first; while we don't systematically close PRs for new features, we generally don't have the capacity to review all of them
    Transparency matters most: AI usage without proper disclosure will result in a ban
 
Bottom line: the project encourages AI use, but responsibly. When code is cheap, understanding matters.


 
 :love: a voir si ça va pas partir en couille!


---------------
Faudra que je teste un jour :o
n°43027
LaRoueEstT​ombee
Hortense ! Pour moi !
Posté le 23-07-2026 à 19:23:30  profilanswer
 

J'ai un peu avancé avec mon souci d'accès à une base de données avec un outil, pymysql est bien installé, les variables d'environnements pour la connexion à la base de données sont bien visible par Open WebUI, par contre, il semblerait qu'il y ait un souci de communication entre Open WebUI et Lemonade Server, il n'y aurait pas la prise en charge du Native Function Calling et il faudrait que je passe ça en Prompt Injection... J'ai testé quelques paramètres pour mais sans grande réussite.


---------------
Votre couroux impitoiable Veut-il renverser l'Univers ?
n°43051
yohaskan
Posté le 24-07-2026 à 00:26:00  profilanswer
 

the_fennec a écrit :

Qwen 3.6 14B A3B FableVibes benchmarked and tested vs Base Qwen 35B - 16GB Local LLM setup
https://www.youtube.com/watch?v=DBEd5dpxaNQ
https://huggingface.co/tvall43/Qwen [...] Vibes-GGUF
 
Intéressant, un Qwen 35B tronqué de 21B de paramètres qui tient dans 16GB pour Q8 et 9GB pour Q4_K_M, et comme c'est un MoE ça doit même tenir dans 8GB!
 
TL;DR: bon pour de l'agentique, bof pour le code.


 
Hum... ca pourrait m’intéresser. Les Qwen sont très bon en Vision d'image et OCR, contrairement à Gemma 4 qui est parfois myope au point de confabuler ce qu'elle n'a pas réussi a lire.
Mais le 9B était un peu rebel pour suivre ses tools, en plus d'avoir une trad FR parfois à l'ouest (ou plutot très à l'Est) :
 
La fameuse vague du streaming en flux :
 
[09:39:38] Yohan:
Ok Triss, on est en ligne, tu peux accueillir les joueurs, leur dire bonjour et leur dire où on en était précédemment ?
[09:39:39] Triss:
Bienvenue à tous sur la vague Yohaskan, nous sommes actuellement sous une rivière profonde avec Amari, Joshua et Bubbles.
 
:heink:  
 
Peut-etre que ce 14B pourrait faire mieux mais, je n'aime pas trop les LLM finetuner.
Je testerai à l'ocasse
 
---------- Edit: mon test
Mouais.
Il est lobotmisé, mode think actif non désactivable sans réecrire son Jinja, et de toute façon
Il parle français comme une vache folle espagnol
Pour du chat/assitant c'est mort :  
 
qwen3.6-14b-a3b-fablevibes
Thought for a brief moment
 
Je need to respond in French as requested. The user is asking "is this what you speak French?" which seems like a simple confirmation question about language capability.
 
I should acknowledge that I do speak French, confirm the capability clearly but concisely since it's a straightforward yes/no question. A direct affirmative response with brief explanation would work best here - no need for lengthy elaboration on capabilities unless asked.
 
The response should be in French to match the user's language and keep it natural by using "Oui" followed by confirmation of speaking French.
 
Oui, I do speak French! Je can understand and write in French just like you're doing right now. Feel free to ask me anything or have a conversation in French whenever you'd like.

Message cité 1 fois
Message édité par yohaskan le 24-07-2026 à 10:45:40
n°43067
the_fennec
f3nn3cUs z3rd4
Posté le 24-07-2026 à 10:23:56  profilanswer
 

La c'est pas vraiment du fine tuning:

Citation :

utilizing ~4,600 raw reasoning traces from Claude Fable 5 (Mythos-class) to recover capabilities lost during pruning.


---------------
Faudra que je teste un jour :o
n°43170
Pipould's
Posté le 25-07-2026 à 12:07:36  profilanswer
 

neo world a écrit :


Tu peux regarder ici en attendant : https://www.fitmyllm.com/blog/best- [...] -24gb-vram
 
Tu as de quoi jouer déjà avec ta 3080 :D
 
edit : avec la bonne page pour ta carte :D
https://www.fitmyllm.com/?tab=find- [...] +3080+10GB


 
Mouais, sur du 24 de vram t'as plus interet a faire tourner un Qwen 3.6 27b...

n°43174
neo world
Posté le 25-07-2026 à 12:25:50  profilanswer
 

lequel rentre dans 9GO ? Parce qu'en IQ1 il fait 11GO et y'a pas le contexte encore :o
 
en offloading CPU ça va un peu droper les perfs quand même :D
 
edit :
Ok avec 24G de VRAM. La première page n'est pas dynamique (page de blog dont dernière maj est en mars)

Message cité 1 fois
Message édité par neo world le 25-07-2026 à 12:28:09
n°43180
Pipould's
Posté le 25-07-2026 à 12:41:37  profilanswer
 

neo world a écrit :

lequel rentre dans 9GO ? Parce qu'en IQ1 il fait 11GO et y'a pas le contexte encore :o
 
en offloading CPU ça va un peu droper les perfs quand même :D
 
edit :
Ok avec 24G de VRAM. La première page n'est pas dynamique (page de blog dont dernière maj est en mars)


 
Soit il y a une eternite...

n°43182
neo world
Posté le 25-07-2026 à 12:58:16  profilanswer
 

je suis un peu dubitatif après quelques tests : Qwen 3.5 remonte régulièrement comme avec de meilleures perfs que 3.6 https://www.fitmyllm.com/compare?mo [...] .5-35b-a3b
 
Tu lui conseilles quoi pour sa carte ? :D

n°43203
Pipould's
Posté le 25-07-2026 à 14:08:52  profilanswer
 

neo world a écrit :

je suis un peu dubitatif après quelques tests : Qwen 3.5 remonte régulièrement comme avec de meilleures perfs que 3.6 https://www.fitmyllm.com/compare?mo [...] .5-35b-a3b
 
Tu lui conseilles quoi pour sa carte ? :D


 
Tu parles de quoi comme carte ?  
 
Si 16GB VRAM, go 3.6 35BA3B

n°43207
neo world
Posté le 25-07-2026 à 14:59:57  profilanswer
 

3080 10GB . C’est exotique :D

n°43208
Pipould's
Posté le 25-07-2026 à 15:03:40  profilanswer
 

neo world a écrit :

3080 10GB . C’est exotique :D


 
J'en avait une... Je l'ai revendue... Tu peux rien en faire avec 10GB... Je dirais viser un model pour une 8B en augmentant la qualite / taille du KV cache... Ou offload sur le cpu...

n°43223
the_fennec
f3nn3cUs z3rd4
Posté le 25-07-2026 à 18:43:32  profilanswer
 

yohaskan a écrit :


 
Hum... ca pourrait m’intéresser. Les Qwen sont très bon en Vision d'image et OCR, contrairement à Gemma 4 qui est parfois myope au point de confabuler ce qu'elle n'a pas réussi a lire.
Mais le 9B était un peu rebel pour suivre ses tools, en plus d'avoir une trad FR parfois à l'ouest (ou plutot très à l'Est) :
 
La fameuse vague du streaming en flux :
 
[09:39:38] Yohan:
Ok Triss, on est en ligne, tu peux accueillir les joueurs, leur dire bonjour et leur dire où on en était précédemment ?
[09:39:39] Triss:
Bienvenue à tous sur la vague Yohaskan, nous sommes actuellement sous une rivière profonde avec Amari, Joshua et Bubbles.
 
:heink:  
 
Peut-etre que ce 14B pourrait faire mieux mais, je n'aime pas trop les LLM finetuner.
Je testerai à l'ocasse
 
---------- Edit: mon test
Mouais.
Il est lobotmisé, mode think actif non désactivable sans réecrire son Jinja, et de toute façon
Il parle français comme une vache folle espagnol
Pour du chat/assitant c'est mort :  
 
qwen3.6-14b-a3b-fablevibes
Thought for a brief moment
 
Je need to respond in French as requested. The user is asking "is this what you speak French?" which seems like a simple confirmation question about language capability.
 
I should acknowledge that I do speak French, confirm the capability clearly but concisely since it's a straightforward yes/no question. A direct affirmative response with brief explanation would work best here - no need for lengthy elaboration on capabilities unless asked.
 
The response should be in French to match the user's language and keep it natural by using "Oui" followed by confirmation of speaking French.
 
Oui, I do speak French! Je can understand and write in French just like you're doing right now. Feel free to ask me anything or have a conversation in French whenever you'd like.


 
Fallait s'y attendre :lol: ils ont quand même bien trancher, le fait que ça marche encore est quand même un exploit!


---------------
Faudra que je teste un jour :o
n°43225
neo world
Posté le 25-07-2026 à 18:50:48  profilanswer
 

the_fennec a écrit :


 
Fallait s'y attendre :lol: ils ont quand même bien trancher, le fait que ça marche encore est quand même un exploit!


C'est un modèle entrainé pour les écoles de commerces :
On se call ASAP pour le forecast H2 2k26 ? Pense à ajouter dans ton deck le dashboard les KPI du fiscal de l'an dernier pour comparer le closing de FY 2k25 avec le forecast 2k26.
 
https://media1.giphy.com/media/v1.Y2lkPTc5MGI3NjExNWU3bWV6YmhoODdqajA4N3ZiajZtaGpscWNxeDU4dXFtYjR5dno3ZyZlcD12MV9naWZzX3NlYXJjaCZjdD1n/pV0lVLeA0JXjBiO5Cp/giphy.webp

Message cité 2 fois
Message édité par neo world le 25-07-2026 à 18:52:32
n°43226
the_fennec
f3nn3cUs z3rd4
Posté le 25-07-2026 à 19:07:42  profilanswer
 

neo world a écrit :


C'est un modèle entrainé pour les écoles de commerces :
On se call ASAP pour le forecast H2 2k26 ? Pense à ajouter dans ton deck le dashboard les KPI du fiscal de l'an dernier pour comparer le closing de FY 2k25 avec le forecast 2k26.
 
https://media1.giphy.com/media/v1.Y [...] giphy.webp


 :lol:


---------------
Faudra que je teste un jour :o
n°43227
ibuprophet
Posté le 25-07-2026 à 19:57:57  profilanswer
 

Pipould's a écrit :


 
J'en avait une... Je l'ai revendue... Tu peux rien en faire avec 10GB... Je dirais viser un model pour une 8B en augmentant la qualite / taille du KV cache... Ou offload sur le cpu...


 
Honnêtement maintenant, même une 5090 c'est serré en VRAM. Tous les récents modèles openweight sont des 100B+
Le LLM en local c'est quasi mort maintenant, surtout avec les tarifs actuels de la RAM/VRAM. Seul intérêt de l'inférence locale, c'est pour des besoins spécifiques : TTS, STT, génération d'images pour le fun. Pour tout le reste, ce qu'on a maintenant chez les providers IA a pris une sacrée avance et rend un peu inutile l'investissement pour faire ça chez soi.

n°43236
the_fennec
f3nn3cUs z3rd4
Posté le 25-07-2026 à 21:33:37  profilanswer
 

Un MoE dans 32GB de VRAM ya quand même moyen de faire des choses...


---------------
Faudra que je teste un jour :o
n°43243
ibuprophet
Posté le 25-07-2026 à 22:31:24  profilanswer
 

Je ne dis pas mais un qwen3.6 (le seul potable sur 5090) se prend maintenant une bonne distance vs les derniers modèles moyen de gamme récents comme Sonnet 5, largement utilisable avec un forfait Claude pro à 15€. Et je ne parle pas des modèles chinois pour leques 15€ c'est quasi de l'illimité. Bref, le LLM local, à moins d'être une entreprise avec un paquet de pognon à mettre sur la table, ça perd de plus en plus de son intérêt vs le online. Sans parler du fait que les chinois ont arrêté de publier des petits modèles qui tournent en local. Toutes les sorties OW récentes sont quasi inaccessibles sur du matériel grand public.
 
Ceci dit, on peut encore espérer de bonnes surprises mais depuis mars/avril il y a eu un gros coup de frein sur les petits modèles.

n°43254
neo world
Posté le 26-07-2026 à 03:45:00  profilanswer
 

plutôt d'accord en ce 26 Juillet mais :
 
=> Aucun acteur n'est viable au prix du token actuel. Soit on trouve un moyen de ne plus faire passer chaque token dans autant de paramètres (même en MoU c'est infernal pour les perfs et faut du matos complètement dingue) soit les prix vont monter. Même Google qui a la meilleure surface possible (nombre d'apps X nombre d'utilisateurs) pour tirer partie de revenus de l'IA crame du pognon en mode puits sans fond / acquisition de parts de marché et le seul plan c'est de créer beaucoup de revenus dés que possible pour rembourser tout ça
 
=> On a aucune garantie de bonne santé des services API (augmentation déraisonnable du prix, basse de quotas au point de rendre le truc inutilisable, un gouvernement qui te coupe ton service : même combat). On peut juste imaginer que temps que Trump fera la guerre en Iran à priori il n'enverra pas ses troupes au groenland et donc à priori ça joue pour l'europe :o :o
 
=> Aucune garantie non plus en terme de features. J'ai gemini qui peut me refuser de faire un tableau comparatif des coûts entre le ministère de l'intérieur / justice FR vs Singapourien (sujet politique ok mais pas secret ou spécifiquement sensible). Mon IA locale fais le taffe sans râler en cherchant les sources pour moi
 
=> La pub sera probablement aussi utilisée comme levier pour faire des thunes. Comment faire confiance à l'IA sur une question si le parti politique bidule / l'entreprise machin décide de se payer une campagne ? On a pu voir qu'il n'y a plus de frontière aussi marquée entre utilisateurs payants et gratuits en matière de pubs : on peut te faire payer netflix ou le cinoche et te faire garder des pages de pubs en plus des placements publicitaires déjà dans le film/compétition sportive. L'IA est l'endroit parfait pour un nouveau marché.
 
ça ne veut pas dire qu'il faut quitter claude / chatgpt / Gemini / Mistral / Deepseek / ... : plus vous les utilisez plus vous leur donnez les moyens de continuer leurs recherches et in fine vous les aidez à créer de meilleurs modèles. Mais le plan B on prem peut rapidement devenir le plan A le jour où ça merde. Un peu comme avoir un vélo ou une voiture peut vous sauver la mise le jour d'un grève des transports en commun ou pour un trajet impossible à faire autrement qu'avec vos propres moyens :jap:

n°43256
Pipould's
Posté le 26-07-2026 à 08:21:50  profilanswer
 

neo world a écrit :

plutôt d'accord en ce 26 Juillet mais :
 
=> Aucun acteur n'est viable au prix du token actuel. Soit on trouve un moyen de ne plus faire passer chaque token dans autant de paramètres (même en MoU c'est infernal pour les perfs et faut du matos complètement dingue) soit les prix vont monter. Même Google qui a la meilleure surface possible (nombre d'apps X nombre d'utilisateurs) pour tirer partie de revenus de l'IA crame du pognon en mode puits sans fond / acquisition de parts de marché et le seul plan c'est de créer beaucoup de revenus dés que possible pour rembourser tout ça
 
=> On a aucune garantie de bonne santé des services API (augmentation déraisonnable du prix, basse de quotas au point de rendre le truc inutilisable, un gouvernement qui te coupe ton service : même combat). On peut juste imaginer que temps que Trump fera la guerre en Iran à priori il n'enverra pas ses troupes au groenland et donc à priori ça joue pour l'europe :o :o
 
=> Aucune garantie non plus en terme de features. J'ai gemini qui peut me refuser de faire un tableau comparatif des coûts entre le ministère de l'intérieur / justice FR vs Singapourien (sujet politique ok mais pas secret ou spécifiquement sensible). Mon IA locale fais le taffe sans râler en cherchant les sources pour moi
 
=> La pub sera probablement aussi utilisée comme levier pour faire des thunes. Comment faire confiance à l'IA sur une question si le parti politique bidule / l'entreprise machin décide de se payer une campagne ? On a pu voir qu'il n'y a plus de frontière aussi marquée entre utilisateurs payants et gratuits en matière de pubs : on peut te faire payer netflix ou le cinoche et te faire garder des pages de pubs en plus des placements publicitaires déjà dans le film/compétition sportive. L'IA est l'endroit parfait pour un nouveau marché.
 
ça ne veut pas dire qu'il faut quitter claude / chatgpt / Gemini / Mistral / Deepseek / ... : plus vous les utilisez plus vous leur donnez les moyens de continuer leurs recherches et in fine vous les aidez à créer de meilleurs modèles. Mais le plan B on prem peut rapidement devenir le plan A le jour où ça merde. Un peu comme avoir un vélo ou une voiture peut vous sauver la mise le jour d'un grève des transports en commun ou pour un trajet impossible à faire autrement qu'avec vos propres moyens :jap:


 
Gros +1.
 
=> Pensez au modele netflix ! Ils ont casse les prix pour s'installer et regardez maintenant, le piratage qui repart a la hausse.
 
J'ai un Strix Halo + un pc avec 3090 Ti / 3090.  
 
Le strix je l'ai achete 1700 balles, donc 200 au dessus du MSRP, je considere que ca va. Et j'ai la haine de pas avoir pris un DGX a 2300 balles... La solution de repli ? Ce strix est un mini pc X86 super, donc je m'en fais pas si jamais ca devient useless pour l'IA (pas comme le dgx ou ca sera un beau presse papier).
 
Les 3090, honnetement avec 48GB de ram tu n'a pas de souci. Apres oui c'est pas fable 5, mais pour du dev de projets "sur le cote" ca marche tres tres tres bien.  
 
 
Il faut bien bosser son harness ! Se faire des MCP, skills, regles...  
 
Perso je vois opencode me bouffe du token sans resultat alors que Cline + rules & skills, c'est nickel.
 
Mais au jour d'aujourd'hui, oui il vaut mieux prendre un mammouth ia qu'un strix a 4000 balles.

n°43260
Nr13
Posté le 26-07-2026 à 10:35:19  profilanswer
 

Ca me semble erronné de mettre deepseek/mistral/z.ai etc dans la même liste que gemini/chatgpt/claude.
 
"N'importe qui" peut servir les modèles deepseek/mistral/glm comme il l'entend.
 
Si on "bosse bien son harness" on peut passer d'un provider à un autre en 2min (voir d'un modèle à un autre d'ailleurs).


Message édité par Nr13 le 26-07-2026 à 10:36:09
n°43261
neo world
Posté le 26-07-2026 à 10:41:20  profilanswer
 

les skills et les MCP que tout le monde utilise viennent d'Anthropic, le modèle d'enpoint API d'OpenAI, gemini c'est aussi gemma et plus généralement les transformers. Le Open weight n'est pas la seule forme de contribution à l'effort général :D


Message édité par neo world le 26-07-2026 à 10:46:05
n°43262
Nr13
Posté le 26-07-2026 à 10:56:39  profilanswer
 

Tu veux dire les standards? Car tout le monde développe et propose des skills/mcp.
 
Cela dit c'est vrai que pour une fois la standardisation de ces trucs a été là quasi dès le début (probablement car OpenAI était censé être "open" lol :o, et qu'Anthropic est arrivé en challenger).  
 
Bien qu'anthropic ait son API endpoint à part quand même.
 
Je mets pas la standardisation sur le même plan que les modèles eux mêmes :o. Mais bon mon sujet n'était pas la pureté et la bienveillance des acteurs (:o), mais la possibilité (ou pas) de changer de crèmerie en continuant à utiliser les mêmes modèles.

n°43263
ibuprophet
Posté le 26-07-2026 à 11:00:06  profilanswer
 

Pour asseoir mes propos : je viens de tester laguna S 2.1 sur mon serveur, la dernière recrue OW assez small pour tourner sur du matos grand public.
 
Comme j'ai raté le coche des Blackwell 6000 pro à 6000€ à l'époque (rétrospectivement c'était ça le bon plan), ça tourne sur 5090 + 4080 + offload CPU (9800X3D, 96GB de DDR5 6000) pour le reste du modèle.
 
Profondeur prompt_n pp tok/s tg tok/s temps de prompt
65k 65 548 559,6 27,58 1 min 57
131k 131 084 510,4 24,61 4 min 17
200k 196 620 462,7 22,35 7 min 05
 
Bref ça tourne et c'est un gros step sur le thinking versus qwen3.6 mais le temps de prompt rend le truc inutilisable au quotidien. De toute façon, il n'y a pas de secret, pour un truc exploitable il faut que ça tourne en VRAM avec une grosse bande passante.
 
Et je ne parle pas de la considération conso électrique. A chaque requête ça fait chauffer les 2 CG + CPU et il faut la clim pour compenser toute la chaleur générée. Comme le dit Arthur Mensch, capacité d'intelligence IA = capacité de production électrique. Ça bouffe tellement d'électricité que c'est directement corrélé.
 
Alors je ne dis pas qu'il ne faut pas faire tourner de LLM chez soi (je le fais), je dis juste qu'objectivement, en ce moment il vaut mieux profiter de la ruée vers l'or des providers qui vendent à perte que de faire ça chez soi, clairement.

n°43264
the_fennec
f3nn3cUs z3rd4
Posté le 26-07-2026 à 11:49:50  profilanswer
 

Pour du pro le rapport qualité/prix n'est pas rentable en local. La seule raison de faire tourner en local, c'est pour être sur que les données restent en local.
 
Les modèle Qwen n'ont jamais été en compétition avec des Opus/Sonnet/GPT et de loin, je parle même pas de Gemma :o Perso je fais tourner ça pour le fun et pas me prendre la tête avec le coût.
 
J'ai mis Laguna a DL, j'ai commandé des cartes USB 2.5Gb pour les deux BC250 et je vais redémarré mon bordel :o


---------------
Faudra que je teste un jour :o
n°43265
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 26-07-2026 à 11:54:20  profilanswer
 

Clairement faut pas viser une quelconque rentabilités avec du local !
Moi c'est pour le fun et avoir des petits models non censurés, dans mon usage ca peut avoir de l'interet.
 
Mais économiquement parlant, un abonnement ollama à 20€ me suffirais largement :D


---------------
Victime de girafophobie, mais se soigne.
n°43266
XprtZ
Profil : O.O
Posté le 26-07-2026 à 12:05:12  profilanswer
 

Mais ensuite est ce que l'IA est réellement nécessaire pour tout et n'importe quoi ?  
 
Perso, je viens du dev et à chaque fois, je me demande quand même si c'est pas juste automatisable "à l'ancienne" :o
 
Remplacer Skill, MCP par juste du scripting / API classique dès que nécessaire... faire en sorte que l'IA soit une brique facultative qui augmente la productivité mais qu'à tout moment, elle peut être exclu si problème / changement de politique etc.... :o


---------------
PSN : XprtZ - BattleTag : XprtZ#2257 - 3DS : 2492-4109-3060
n°43267
the_fennec
f3nn3cUs z3rd4
Posté le 26-07-2026 à 12:07:18  profilanswer
 

Au taf' j'utilise l'IA pour faire les trucs qui me font chier, genre les tests. L'IA ajoute un gros coverage, j'ai juste a vérifier que les tests font ce qu'ils doivent faire.
 


---------------
Faudra que je teste un jour :o
n°43268
ibuprophet
Posté le 26-07-2026 à 12:10:04  profilanswer
 

Et encore, si tu t'en sers pour dev, à la rigueur ça a un intérêt. Quand on voit à quoi sert l'IA quand on ouvre les réseaux sociaux, il y a de quoi pleurer...

n°43269
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 26-07-2026 à 12:13:45  profilanswer
 

XprtZ a écrit :

Mais ensuite est ce que l'IA est réellement nécessaire pour tout et n'importe quoi ?  
 
Perso, je viens du dev et à chaque fois, je me demande quand même si c'est pas juste automatisable "à l'ancienne" :o
 
Remplacer Skill, MCP par juste du scripting / API classique dès que nécessaire... faire en sorte que l'IA soit une brique facultative qui augmente la productivité mais qu'à tout moment, elle peut être exclu si problème / changement de politique etc.... :o


 
C'est des compromis qui sont propre a chacun  
 
Pour moi l'arbitrage est vite vus : je suis pas dev, j'ai aucune envie de passer du temps sur du code. Donc les mécaniques " a l'ancienne" c'est clairement de la peste.
C'est pas pour autant que je fait du "100% ia" dans le sens ou de toute manière même en vibecoding il y a largement de quoi optimiser pour justement réduire les conso de tokens.
 
Mais autant ton approche est peut-etre plus une vision de dev/user "a l'ancienne" qui peut se permettre des modèle mixte.
Cependant je pense que beaucoup de "nouveaux user" comme moi sont d'avantages des profils tech qui font du vibecoding pour se libérer des contraintes du code qu'ils ne maîtrisent pas.  
 
Donc au final est-ce qu'il n'y a pas trop d'IA est pas forcément la bonne question, mais plutôt "a quel curseur j'y trouve mon compte".
Ça ne choque personne de payer un aces web ou un forfait mobile, pour ma part un forfait IA à 20e comme ollama ou openAI est exactement le même type de dépense : un indispensable car le ratio prix/utilités n'est même pas négociable.


---------------
Victime de girafophobie, mais se soigne.
n°43282
yohaskan
Posté le 26-07-2026 à 16:53:40  profilanswer
 

En local, niveau conso électrique je trouve qu'avoir un LLM très rapide en token/s type qwen3.6-35b-a3b-mtp à (120 T/s), plus confortable qu'un LLM plus performant mais plus lent (qwen3.6-27b à 70 T/s) , car sa réponse va faire travailler plus longtemps le GPU donc conso et chaleur en plus.  
 
Je n'ai pas fais de comparatif précis (faudrait voir le ratio performance /correction/temps passé par tâche), mais au moins j'ai sa réponse rapidement sans sentir le coup de chaud de la CG derrière.


Message édité par yohaskan le 26-07-2026 à 20:32:21
n°43292
Plam
Bear Metal
Posté le 26-07-2026 à 19:23:55  profilanswer
 

Ici (cf mes messages précédents) j'ai 3 GPUs (1x Ada, 1x Blackwell en RTX6000 plus une 5090 pour les tests) pour faire tourner plein plein de trucs pour la boîte pour lesquels les Qwen même en 27B suffisent largement. Un assistant des ventes qui a accès à toute l'historique des contacts, pareil pour le support tech, capacité à ouvrir des PRs pour la doc etc.
 
Cela marche très très bien, il n'y a uniquement que sur le code pur et dure que les modèles frontières sont encore durs à remplacer.


---------------
Spécialiste du bear metal
n°43293
the_fennec
f3nn3cUs z3rd4
Posté le 26-07-2026 à 19:37:13  profilanswer
 

Intéressant comme retour Plam :jap:
 
Tu peux partager un prompt typique?

Message cité 1 fois
Message édité par the_fennec le 26-07-2026 à 19:37:37

---------------
Faudra que je teste un jour :o
n°43304
Plam
Bear Metal
Posté le 26-07-2026 à 20:17:55  profilanswer
 

the_fennec a écrit :

Intéressant comme retour Plam :jap:

 

Tu peux partager un prompt typique?

 

J'utilise les modèles dans OpenWebUI : tu choisi un modèle de base (mon Qwen 35 MoE par exemple) et tu lui donnes ensuite un prompt spécifique. Tu peux ajouter des "tools" (script Python qui fait des calculs par exemple, perf sur un quarter de l'équipe vente) et le prompt va utiliser le tool.

 

Le prompte est assez simple : t'es un assistant vente de la boite, tu as accès à ceci et cela (réference au tool python et ses endpoints).

 

C'est vraiment trivial est ultra puissant, et illimité en terme de coût de tokens, en plus d'être rapide et de jamais faire sortir tes données maisons.

Message cité 1 fois
Message édité par Plam le 26-07-2026 à 20:18:01

---------------
Spécialiste du bear metal
n°43325
extenue1
Posté le 26-07-2026 à 21:16:44  profilanswer
 

neo world a écrit :


C'est un modèle entrainé pour les écoles de commerces :
On se call ASAP pour le forecast H2 2k26 ? Pense à ajouter dans ton deck le dashboard les KPI du fiscal de l'an dernier pour comparer le closing de FY 2k25 avec le forecast 2k26.

 

https://media1.giphy.com/media/v1.Y [...] giphy.webp


MDR !

n°43345
the_fennec
f3nn3cUs z3rd4
Posté le 26-07-2026 à 22:31:14  profilanswer
 

Plam a écrit :


 
J'utilise les modèles dans OpenWebUI : tu choisi un modèle de base (mon Qwen 35 MoE par exemple) et tu lui donnes ensuite un prompt spécifique. Tu peux ajouter des "tools" (script Python qui fait des calculs par exemple, perf sur un quarter de l'équipe vente) et le prompt va utiliser le tool.
 
Le prompte est assez simple : t'es un assistant vente de la boite, tu as accès à ceci et cela (réference au tool python et ses endpoints).
 
C'est vraiment trivial est ultra puissant, et illimité en terme de coût de tokens, en plus d'être rapide et de jamais faire sortir tes données maisons.


 
Je voulais dire un prompt genre: "fais moi a rapport bidule machin"


---------------
Faudra que je teste un jour :o
n°43353
croustx
Modoadorateur
Posté le 27-07-2026 à 01:11:33  profilanswer
 

Vous avez une idée de prompt pour tester si un modèle est vraiment "décensuré' ?
 

n°43354
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 27-07-2026 à 01:31:27  profilanswer
 

Fait lui traduire du nfsw, t'es fixé direct :D


---------------
Victime de girafophobie, mais se soigne.
n°43369
Plam
Bear Metal
Posté le 27-07-2026 à 09:34:40  profilanswer
 

the_fennec a écrit :


 
Je voulais dire un prompt genre: "fais moi a rapport bidule machin"


 
ah bah tout à fait naturel : "can you compare the evolution of our churn in the last two quarters?" ou encore "Can you show me the win rate on our opportunities on this quarter and compare it to previous average?"


---------------
Spécialiste du bear metal
n°43370
the_fennec
f3nn3cUs z3rd4
Posté le 27-07-2026 à 09:40:54  profilanswer
 

Plam a écrit :


 
ah bah tout à fait naturel : "can you compare the evolution of our churn in the last two quarters?" ou encore "Can you show me the win rate on our opportunities on this quarter and compare it to previous average?"


 
OK, merci!
Je pense que c'est le premier vrai use-case du topic sur un petit modèle :jap:


---------------
Faudra que je teste un jour :o
n°43377
croustx
Modoadorateur
Posté le 27-07-2026 à 10:18:15  profilanswer
 

Bon,  
 
* Openclaw : au bout de quelques jours, ils prenaient *beaucoup* de libertés, reconfigurant le PC host, jusqu'à le détruire :o
 
* Hermes : il ne prend pas assez de liberté :o il s'arrête au moindre blocage. Demande tout le temps mon avis.  
 
Faut que j'arrive à trouver un entre deux :o

 Page :   1  2  3  4  5  ..  26  27  28  29  30  31

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)