Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
3510 connectés 

 


Je génère ...
Sondage à 3 choix possibles.
Ce sondage expirera le 20-09-2026 à 10:00




Attention si vous cliquez sur "voir les résultats" vous ne pourrez plus voter

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  55  56  57  58  59  60  61
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°47373
M300A
Posté le 02-09-2026 à 22:59:14  profilanswer
 

Reprise du message précédent :
GLM 5.3 flash tourne bien chez moi, je suis très content, d'autres utilisateurs moins. Je pense qu'ils promptent en français ou en allemand et se tapent des réponses en chinois. Moi je bosse en anglais et ça ne m'arrive pas.
Je trouve sa capacité de langage humain correcte, similaire à DS4 Flash. C'est un peu plus lent mais c'est plus précis sur les problèmes cachés dans du code complexe.


Message édité par M300A le 02-09-2026 à 23:30:24

---------------
:wq
n°47375
neo world
Posté le 02-09-2026 à 23:22:31  profilanswer
 

top ! vous avez prévu d'étendre votre ferme (pour par exemple proposer DS4 flash en parallèle aux déçus de GLM ou faire un gros cluster pour K3 ou équivalent en modèle frontier) ?
 
Vous en sortez combien de tokens par seconde histoire de nous faire baver ? :D

n°47376
M300A
Posté le 02-09-2026 à 23:29:42  profilanswer
 

Aucune idée mais je sur chaque log de vllm je suis entre 100 et 200 token/s, ça semble constant peut importe le nombre d'utilisateurs simultanés.

 

Pour l'instant on garde 4, je devais en rendre une pour un projet, mais finalement on en commande 2 de plus pour que je garde mes 4.
A terme c'est probable qu'on remplisse la machine a 8 puis qu'on en commande une seconde, on verra.... C'est comme partout, la tendance est plutôt aux économies malheureusement

 

Un de mes prochains projets serait d'intégrer le LLM pour faire de l'aide à la décision dans une application existante, vaste projet sur je sais pas encore sous quel angle l'aborder (voir topic dev IA). En attendant malheureusement, je vais surtout m'en servir pour pondre des milliers de lignes d'ETL maison pour des projets que je dois livrer.  :sweat:


Message édité par M300A le 02-09-2026 à 23:32:39

---------------
:wq
n°47377
M300A
Posté le 02-09-2026 à 23:37:59  profilanswer
 

Aujourd'hui j'ai utilisé GLM pour debugguer une application de merde d'un fournisseur en C dont on a pas les sources. En heure d'été les timestamps insérés en DB sont une heure dans le turfu.

 

Heureusement le binaire n'est pas strippé donc il a pu debugguer ça et identifier dans l'appli des appels a strptime qui passe 0 sur une structure entraînant une heure forcée sans DST. En passant -1, ça demande à libc de choisir DST ou pas en fonction de l'heure fournie (https://stackoverflow.com/questions [...] -struct-tm)
Je lui ai fait vérifié l'ensemble de l'App pour confirmer que le problème est contenu au contexte identifié, puis créer un shim pour remplacer strptime avec un LD_PRELOAD, intégration systemd et script Python pour batch-fix les données existantes.

 

Pour finir, envoie de tout ça directement sur le ticket Redmine avec un MCP, maintenant c'est le problème d'un collègue.

 

C'était cool :D

Message cité 1 fois
Message édité par M300A le 03-09-2026 à 00:12:05

---------------
:wq
n°47378
neo world
Posté le 02-09-2026 à 23:40:19  profilanswer
 

c'est un bon usage de vous débarrasser de la production de milliers de lignes de trucs chiants à écrire :D
 
L'aide à la decision c'est casse gueule : le llm fera des miracles sur des patterns reconnaissables de de lignes de code mais pour de la décision ça turbo hallucine facilement (encore tout à l'heure Claude me propose d'augmenter la valeur d'un timeout qui était de 300s vers 900s ... la panne intervenait à 120secondes précis ... )
 
Par contre si vous avez plein de documents à compiler (par exemple les quaterly earning calls) pour alimenter un dashboard qu'un humain lit pour prendre une décision là à mon avis y'a un bon potentiel :D
 
En tous cas y'a jamais assez de matos dans ce topic décidément :o

n°47379
M300A
Posté le 02-09-2026 à 23:47:58  profilanswer
 

S'en débarrasser c'est vite dit, c'est moi qui review tout ça et qui essaye d'organiser tous ces putains de mappings avant de revenir vers la direction... (Toujours arriver avec A ou B pour leur donner un truc pas important à choisir mais garder le contrôle de specs pour pas que ça parte pas en sucette  [:ddr555] )


Message édité par M300A le 02-09-2026 à 23:48:35

---------------
:wq
n°47380
neo world
Posté le 02-09-2026 à 23:52:34  profilanswer
 

M300A a écrit :

Aujourd'hui j'ai utilisé GLM pour debugguer une application de merde d'un fournisseur en C dont on a pas les sources. En heure d'été les timestamps insérés en DB sont une heure dans le turfu.
 
Heureusement le binaire n'est pas strippé donc il a pu debugguer ça et identifier dans l'appli des appels a strptime dans l'application du fournisseur qui passe 0 sur une structure entraînant une heure forcée sans DST. En passant -1, ça demande à libc de choisir DST ou pas en fonction de l'heure fournie.
Je lui ai fait vérifié l'ensemble de l'App pour confirmer que le problème est contenu au contexte identifié, puis créer un shim pour remplacer strptime avec un LD_PRELOAD, intégration systemd et script Python pour batch-fix les données existantes.
 
Pour finir, envoie de tout ça directement sur le ticket Redmine avec un MCP, maintenant c'est le problème d'un collègue.
 
C'était cool :D


Classe, vous gérez comment l'accès à vos systèmes par le LLM ? Il peut executer des trucs en prod (rm -rf * / DROP table; ... :o ) ou tu copies sur ton client (agent ? Un IDE ?) les binaires et bouts de données pour troubleshot ?

n°47382
M300A
Posté le 02-09-2026 à 23:57:01  profilanswer
 

Nan je copie ça en local et je lance un OpenCode dans le folder.

 

Normalement tout est firewallé dans tous les sens et l'accès à des serveurs de prod n'est de toute façon pas accessible depuis de postes utilisateurs/vpn. Je me grant l'accès parfois mais je me l'enlève quand j'ai fini.
D'autres collègues ont aussi des privilèges trop importants, je serre les fesses quand je les vois prompter  [:ddr555].
Jusqu'ici tout va bien, on a de toute façon une solution de backup rock-solid avec comptes séparés, 2fa, multi site et export offline donc au pire :o

 

Dans le cas présent l'agent a mocké une DB sur ma machine en reprenant des payloads depuis le ticket qu'un collègue avait fait. Il avait aussi fait une analyse statistique pour confirmer que ça ne touchait que l'heure d'été mais je sais pas comment il a fait pour ça, je pense qu'il a chargé un dump car normalement il n'a pas d'accès direct à cette DB non plus et il est pas censé se donner le droit (et je pense pas qu'il l'ai fait)

Message cité 1 fois
Message édité par M300A le 02-09-2026 à 23:59:19

---------------
:wq
n°47383
neo world
Posté le 03-09-2026 à 00:02:51  profilanswer
 

faudra que je regarde le côté sécu justement : j'ai assez de place en mémoire pour faire tourner un modèle uncensored pour chercher des bouts de code mal sécurisés et pentester les services que j'expose avant qu'un autre ait la même idée de le faire chez moi à ma place :o
 
Mais idéalement je ne voudrais pas devoir faire des excuses à huggingface / la dgfip / le pentagone parce qu'en fait mon outil a fait d'autres trucs sans forcément demander avant :o


Message édité par neo world le 03-09-2026 à 00:03:19
n°47384
M300A
Posté le 03-09-2026 à 00:05:31  profilanswer
 

J'ai pas encore trop essayé ça a, après c'est pas tellement mon domaine


---------------
:wq
n°47385
neo world
Posté le 03-09-2026 à 00:09:32  profilanswer
 

la question risque de se poser chez vous aussi assez rapidement. Pas forcément pour de la recherche de bugs / failles / pentests comme dans mon lab mais pour accélerer la productivité sans finir par restaurer les apps de prod tous les deux jours parce l'IA super intelligente du futur s'est comportée comme un stagiaire :o

n°47389
speedboyz3​0
Guide Michelin :o
Posté le 03-09-2026 à 07:31:14  profilanswer
 

M300A a écrit :

Nan je copie ça en local et je lance un OpenCode dans le folder.
 
Normalement tout est firewallé dans tous les sens et l'accès à des serveurs de prod n'est de toute façon pas accessible depuis de postes utilisateurs/vpn. Je me grant l'accès parfois mais je me l'enlève quand j'ai fini.
D'autres collègues ont aussi des privilèges trop importants, je serre les fesses quand je les vois prompter  [:ddr555].
Jusqu'ici tout va bien, on a de toute façon une solution de backup rock-solid avec comptes séparés, 2fa, multi site et export offline donc au pire :o
 
Dans le cas présent l'agent a mocké une DB sur ma machine en reprenant des payloads depuis le ticket qu'un collègue avait fait. Il avait aussi fait une analyse statistique pour confirmer que ça ne touchait que l'heure d'été mais je sais pas comment il a fait pour ça, je pense qu'il a chargé un dump car normalement il n'a pas d'accès direct à cette DB non plus et il est pas censé se donner le droit (et je pense pas qu'il l'ai fait)


 
Tu bosses dans quoi déjà ? C'est un sacré joujou quand même !
Vous ne vouliez pas passer par du cloud ?

n°47414
croustx
Modoadorateur
Posté le 03-09-2026 à 11:23:24  profilanswer
 

Question recherches :
 
J'ai monté un système de veille, basé sur SearXNG.
 
Il utilise intensivement plusieurs moteurs de recherches.
 
J'aimerai bien qu'il attaque aussi le darkweb, et même d'autres trucs un peu plus confidentiels.
 
Vous avez des idées ?

n°47415
the_fennec
f3nn3cUs z3rd4
Posté le 03-09-2026 à 11:33:07  profilanswer
 

Tu peux ajouter tes propres moteurs:
https://docs.searxng.org/admin/sett [...] gines.html


---------------
Faudra que je teste un jour :o
n°47421
neo world
Posté le 03-09-2026 à 11:58:08  profilanswer
 

croustx a écrit :

Question recherches :
 
J'ai monté un système de veille, basé sur SearXNG.
 
Il utilise intensivement plusieurs moteurs de recherches.
 
J'aimerai bien qu'il attaque aussi le darkweb, et même d'autres trucs un peu plus confidentiels.
 
Vous avez des idées ?


Prêt à sourcer des macs sur le darkweb pour animer le topic de location de llm je suppose ?  [:biiij:4] :o

Message cité 1 fois
Message édité par neo world le 03-09-2026 à 11:58:35
n°47422
croustx
Modoadorateur
Posté le 03-09-2026 à 12:04:42  profilanswer
 

neo world a écrit :


Prêt à sourcer des macs sur le darkweb pour animer le topic de location de llm je suppose ?  [:biiij:4] :o


 
 [:potoroz]

n°47423
croustx
Modoadorateur
Posté le 03-09-2026 à 12:05:13  profilanswer
 


 
 
J'ai déjà 5 ou 6 moteurs de recherches, mais je me rend pas compte à quel point ils ont de la visibilité

n°47425
speedboyz3​0
Guide Michelin :o
Posté le 03-09-2026 à 12:15:06  profilanswer
 

Je crois que j'ai trouvé un bon plan pour ceux qui sont intéressés par une machine neuve :o

 

Une RTX PRO 4000 Blackwell (24GB) ça sort en ce moment dans les ~3500 euros?

 

Avec les offres étudiants sur Lenovo, on peut avoir pour ~3700 euros:

 

ThinkStation P3 Tower Intel Ultra 5 245 vPro
32 Go DDR5-5 600MT/s (UDIMM)
RTX Pro 4000 24GB
2 To SSD M.2 2280 PCIe Gen4 TLC Opal
2 To 7 200rpm HDD 3,5" SATA
Carte Ethernet Realtek RTL8125BGS PCIe 2,5 Gb
Intel® Wi-Fi 7 BE200 2x2 BE vPro® et Bluetooth® 5.4
Alimentation de 1 100W efficace à 92 %

 

Ça semble pas si mal  [:zyzz:2]

Message cité 1 fois
Message édité par speedboyz30 le 03-09-2026 à 13:09:06
n°47427
speedboyz3​0
Guide Michelin :o
Posté le 03-09-2026 à 13:10:58  profilanswer
 

Et pour 1000 euros de plus on passe sur une RTX PRO 4500 Blackwell 32Go GDDR7 :o

n°47428
neo world
Posté le 03-09-2026 à 13:13:04  profilanswer
 

speedboyz30 a écrit :

Je crois que j'ai trouvé un bon plan pour ceux qui sont intéressés par une machine neuve :o
 
Une RTX PRO 4000 Blackwell (24GB) ça sort en ce moment dans les ~3500 euros?
 
Avec les offres étudiants sur Lenovo, on peut avoir pour ~3700 euros:  
 
ThinkStation P3 Tower Intel Ultra 5 245 vPro  
32 Go DDR5-5 600MT/s (UDIMM)
RTX Pro 4000 24GB
2 To SSD M.2 2280 PCIe Gen4 TLC Opal
2 To 7 200rpm HDD 3,5" SATA
Carte Ethernet Realtek RTL8125BGS PCIe 2,5 Gb
Intel® Wi-Fi 7 BE200 2x2 BE vPro® et Bluetooth® 5.4
Alimentation de 1 100W efficace à 92 %
 
Ça semble pas si mal  [:zyzz:2]


si on est pas allergique à l'occaz tu dois pouvoir trouver un ordinateur avec 32GO de RAM et deux RTX 3090 pour à peu prêt le même tarif. Évidemment pas de matos neuf à ce prix :jap:

n°47439
speedboyz3​0
Guide Michelin :o
Posté le 03-09-2026 à 15:50:39  profilanswer
 

Vous vous souvenez qu'hier je vous parlais des PC à base de NVIDIA GB10? :o Et ben ils ont tous pris ~1000 euros dans la nuit  [:la chancla:1]  
 
Asus GX10 et Lenovo étaient encore à 4100/4200 euros.
 
Au moins je n'hésite plus :o
 
Ce topic est surveillé c'est pas possible  [:speedboyz30:3]

n°47442
lapin
Posté le 03-09-2026 à 16:05:41  profilanswer
 

Ça bouge très vite sur Llama.cpp sur Github: https://github.com/ggml-org/llama.cpp/releases

n°47444
b-tzu
Geek a toute heure...
Posté le 03-09-2026 à 16:14:54  profilanswer
 

speedboyz30 a écrit :

Vous vous souvenez qu'hier je vous parlais des PC à base de NVIDIA GB10? :o Et ben ils ont tous pris ~1000 euros dans la nuit  [:la chancla:1]  
 
Asus GX10 et Lenovo étaient encore à 4100/4200 euros.
 
Au moins je n'hésite plus :o
 
Ce topic est surveillé c'est pas possible  [:speedboyz30:3]


4400 sur joybuy


---------------
Topic Ventes || Topic Jeux Vidéos || Topic Téléphonie (Rien pour le moment)
n°47445
neo world
Posté le 03-09-2026 à 16:15:40  profilanswer
 

speedboyz30 a écrit :

Vous vous souvenez qu'hier je vous parlais des PC à base de NVIDIA GB10? :o Et ben ils ont tous pris ~1000 euros dans la nuit  [:la chancla:1]  
 
Asus GX10 et Lenovo étaient encore à 4100/4200 euros.
 
Au moins je n'hésite plus :o
 
Ce topic est surveillé c'est pas possible  [:speedboyz30:3]


Tu voudrais pas nous parler du strix halo ? J’ai un plan pour partir à la retraite en avance mais il commence par un pump du prix du bosgame :o

n°47452
speedboyz3​0
Guide Michelin :o
Posté le 03-09-2026 à 16:35:29  profilanswer
 

b-tzu a écrit :


4400 sur joybuy

 

Non
https://rehost.diberie.com/Picture/Get/t/541030


Message édité par speedboyz30 le 03-09-2026 à 16:38:33
n°47455
the_fennec
f3nn3cUs z3rd4
Posté le 03-09-2026 à 16:44:30  profilanswer
 

b-tzu a écrit :


4400 sur joybuy


 
Si il était dispo, t'irais vraiment donner 4k a Joybuy?


---------------
Faudra que je teste un jour :o
n°47459
speedboyz3​0
Guide Michelin :o
Posté le 03-09-2026 à 16:56:46  profilanswer
 

the_fennec a écrit :


 
Si il était dispo, t'irais vraiment donner 4k a Joybuy?


 
Non plus :D

n°47463
AllenMadis​on
Oracle du Keb's
Posté le 03-09-2026 à 17:06:35  profilanswer
 

J'ai bien acheté un routeur à 130 balles au lieu de 440 sur joybuy :o (bon c'était y'a longtemps :o)


---------------
Nothing much to teach, man. There's ze high, there's ze low and yall still fucking miss.
n°47470
the_fennec
f3nn3cUs z3rd4
Posté le 03-09-2026 à 17:27:02  profilanswer
 

AllenMadison a écrit :

J'ai bien acheté un routeur à 130 balles au lieu de 440 sur joybuy :o (bon c'était y'a longtemps :o)


T'as oublié un zéro dans l'équation :o


---------------
Faudra que je teste un jour :o
n°47472
the_fennec
f3nn3cUs z3rd4
Posté le 03-09-2026 à 18:05:45  profilanswer
 

Introducing K2 Horizon: Frontier Performance, Radically Open
https://ifm.ai/blog/k2
https://huggingface.co/collections/IFM/k2-horizon
https://www.reddit.com/r/LocalLLaMA [...] ging_face/
 

Citation :

The first fully open model fleet for agents.
K2 Horizon is the first open model family to expose the complete development process through agentic post-training. By releasing checkpoints, data (or data recipe), code, configurations, and training logs across every stage, K2 Horizon makes it possible to study how reasoning, tool use, planning, and agentic capabilities emerge; reproduce the methods that create them; and adapt those methods to new tools, environments, and domains.


 
Le 36B-A4B pourrait être intéressant si il tient face a Qwen:
https://huggingface.co/IFM/K2-Horizon-MoVA-36B-A4B
 
https://i.imgur.com/qowkFhl.png

Message cité 1 fois
Message édité par the_fennec le 03-09-2026 à 18:08:00

---------------
Faudra que je teste un jour :o
n°47474
moyen_moin​s
chat réincarné
Posté le 03-09-2026 à 18:12:36  profilanswer
 

the_fennec a écrit :

Introducing K2 Horizon: Frontier Performance, Radically Open
https://ifm.ai/blog/k2
https://huggingface.co/collections/IFM/k2-horizon
https://www.reddit.com/r/LocalLLaMA [...] ging_face/
 

Citation :

The first fully open model fleet for agents.
K2 Horizon is the first open model family to expose the complete development process through agentic post-training. By releasing checkpoints, data (or data recipe), code, configurations, and training logs across every stage, K2 Horizon makes it possible to study how reasoning, tool use, planning, and agentic capabilities emerge; reproduce the methods that create them; and adapt those methods to new tools, environments, and domains.


 
Le 36B-A4B pourrait être intéressant si il tient face a Qwen:
https://huggingface.co/IFM/K2-Horizon-MoVA-36B-A4B
 
https://i.imgur.com/qowkFhl.png


sur le bc-250 avec sa carte en plus si ça marche :whistle:

n°47475
the_fennec
f3nn3cUs z3rd4
Posté le 03-09-2026 à 18:15:13  profilanswer
 

moyen_moins a écrit :


sur le bc-250 avec sa carte en plus si ça marche :whistle:


 
Ya pas de gguf encore, même pas les weights de base encore. Mais c'est toujours bienvenue d'avoir des nouveaux, surtout si ils donnent toutes les sources de training! Juste le nom du modèle qui n'est pas très bien choisis :o


---------------
Faudra que je teste un jour :o
n°47477
the_fennec
f3nn3cUs z3rd4
Posté le 03-09-2026 à 18:21:02  profilanswer
 

Qwen-3.8-Next-Flash Ngram Hot-Swappable Knowledge Injector for llama.cpp
https://www.reddit.com/r/LocalLLaMA [...] knowledge/
 

Citation :

Can this be used as a new way of low-cost training? Perhaps. Its not easy at the current state but with simple modifications, I think you could easily create models with long-term instantaneously hot-swappable memory.


 
Ça c'est intéressant, pouvoir changer un modèle a la volée :love:.
Genre t'as plus besoin de contexte, tu édites les ngrams en direct!
 
edit:
 [:graffin]  

Citation :


youcloudsofdoom
 
This would be great if you could add a live update of a codebase as part of the model weights, reducing the need for adding to context with a large AGENTS file or spending build time searching for sections within a large project...  
 
ortegaalfredo (Op)
I did this with exact that use case in mind. It's kinda hard to do it currently, as you can only inject simple concepts into the table and it's hard to map complex concepts to a ngram row. But this is just the first version and I think it can be done.


Message édité par the_fennec le 03-09-2026 à 18:23:03

---------------
Faudra que je teste un jour :o
n°47478
b-tzu
Geek a toute heure...
Posté le 03-09-2026 à 18:41:53  profilanswer
 

the_fennec a écrit :


 
Si il était dispo, t'irais vraiment donner 4k a Joybuy?


C’est un concurrent sérieux de Amazon, rien à voir avec AliExpress. Alors oui si c’est gagner 1000 balles je les mets


---------------
Topic Ventes || Topic Jeux Vidéos || Topic Téléphonie (Rien pour le moment)
n°47480
speedboyz3​0
Guide Michelin :o
Posté le 03-09-2026 à 19:01:40  profilanswer
 

Bref c’est pas dispo.
 
Par contre,  
 

Citation :

NVIDIA is locking in the release window for its Arm-based RTX Spark platform. At IFA 2026, the company confirmed that RTX Spark Windows PCs spanning compact desktops and thin-and-light laptops will arrive in just a few weeks with designs from over half a dozen OEM partners. These systems represent a new class of hardware pairing a 20-core NVIDIA Grace CPU with an RTX Blackwell GPU to deliver up to 1 petaflop of local AI compute, paired with up to 128GB of unified memory.
 
Meanwhile, Acer has unveiled a small form factor (SFF) RTX Spark design that crams NVIDIA's superchip into a stylish mini PC design.


 
https://hothardware.com/news/nvidia [...] nd-october
https://img3.super-h.fr/images/2026/09/03/snapshot_421229944382614337.jpg


Message édité par speedboyz30 le 03-09-2026 à 19:07:14
n°47481
speedboyz3​0
Guide Michelin :o
Posté le 03-09-2026 à 19:09:08  profilanswer
 

On perd déjà les ConnectX-7 :/
D’où augmentation de prix avant le lancement  [:leve le pied jeannot:4]

n°47482
neo world
Posté le 03-09-2026 à 19:42:17  profilanswer
 

P'tit retour sur le bosgamePC M5 Strix Halo avec PI.dev en client (zéro extension), Qwen 3.8 flash next en modèle et Lemonade web server pour la partie gestion / téléchargement de modèles :
 
Déjà pas de thottling sur la puce. Pour les SSD NVME j'ai des kingston NV3 (celui fourni avec la machine + un second acheté "pas cher" ) dont les contrôleurs ont tendance à surchauffer (même en empilant des pads thermiques pour qu'ils soient bien en contact avec le dissipateur cuivre) en genre 30 secondes (attention dissipateur extra plat uniquement. Y'a pas de place dans la trappe pour plus haut avec des ailettes).
 
J'ai résolu le problème de throttling des NVME en achetant un "support ventilé (en fait deux 120mm vissés ensemble avec 4 pattes et un connecteur USB pour les alimenter directement depuis la machine). Les nvme sont en dessous donc ça souffle directement dessus  
 
J'ai du quand même déménager la machine dans un autre rack (petit, aussi étanche à l'eau et à la poussière donc fatalement mal ventilé mais avec pour seul voisinage du matos réseau sans disque mécanique) : les disques du NAS commençaient à souffrir du voisinage avec le bestiau dont la puce bouffe quand même 84 watts (le CPU se tourne les pouces) :  
 
https://rehost.diberie.com/Picture/Get/f/541070
 
Question modèle y'a quand même du déchet sur le MTP mais ça reste efficace. Pendant les sessions de code en particulier on flirt avec les 90% de tokens acceptés avec -n 4. Y'a p'têtre moyen de jouer un peu plus haut pour aller grapiller d'avantage de tokens par seconde du coup mais avec un risque de déchets plus important sur la réflexion (laissée active) / les appels d'outils  :D
 
https://rehost.diberie.com/Picture/Get/f/541072
 
Pour l'instant mon modèle ( https://atomic.chat/blog/guides/how [...] xt-locally ) n'offre pas les extensions yarn pour traiter 1M de tokens en contexte mais dans les faits à 260k y'a quand même moyen de bosser et la compaction qui démarre à 93% du total de tokens permet de continuer easy peasy :jap:
 
Pas mal intéressé par les modèles K2 horizon pour faire la passe de correction de code (via l'extention open code review sorti par alibaba) histoire de ne pas demander au même modèle de faire la correction du boulot fait juste avant (c'est parfait du premier coup. Étonnant ! :o)
 
J'ai téléchargé aussi un modèle debridé pour faire la partie forensic / detection de problèmes de sécurité mais ça va attendre que je l'isole proprement avant qu'il attaque la NSA pour récupérer des outils pour faire un meilleurs pentest / red team sur mon app perso @ 2 balles :o
 
Côté Lemonade c'est pas aussi parfait que lm studio mais c'est un très bon moyen de trouver des modèles / télécharger / lancer / bazarder sans pondre une ligne de code. Ils sont assez réactifs aussi (j'avais un problème de timeout impossible à changer sur les appels "cloud externe" (en faire mon llama sur mesure) résolu après le téléchargement d'une nouvelle version de Lemonade  [:implosion du tibia]

n°47483
the_fennec
f3nn3cUs z3rd4
Posté le 03-09-2026 à 19:42:23  profilanswer
 

b-tzu a écrit :


C’est un concurrent sérieux de Amazon, rien à voir avec AliExpress. Alors oui si c’est gagner 1000 balles je les mets


 
Le support est correct? Je pensais que c'était un Temu-like.


---------------
Faudra que je teste un jour :o
n°47484
the_fennec
f3nn3cUs z3rd4
Posté le 03-09-2026 à 19:47:03  profilanswer
 

neo world a écrit :

P'tit retour sur le bosgamePC M5 Strix Halo avec PI.dev en client (zéro extension), Qwen 3.8 flash next en modèle et Lemonade web server pour la partie gestion / téléchargement de modèles :
...
 


 
Je vais finir par me laisser tenter :o
 

neo world a écrit :


Pas mal intéressé par les modèles K2 horizon pour faire la passe de correction de code (via l'extention open code review sorti par alibaba) histoire de ne pas demander au même modèle de faire la correction du boulot fait juste avant (c'est parfait du premier coup. Étonnant ! :o)


 
Attention, ça vient pas de Kimi :D


---------------
Faudra que je teste un jour :o
n°47485
the_fennec
f3nn3cUs z3rd4
Posté le 03-09-2026 à 19:51:00  profilanswer
 

Qwen 3.8 27B GSQ RCO tested - 16GB Local LLM setup
Luke's Dev Lab
https://www.youtube.com/watch?v=jFHu6wx_TMQ
https://huggingface.co/ISTA-DASLab/ [...] Q-RCO-GGUF
 
TL;DR
Une nouvelle façon de quantizer prometteuse: un Q3_S MTP de 12GB qui tient la route sur ses benchs Blender et Godot, c'est balaise!
 
request for qwen3.8 next :love:  
https://huggingface.co/ISTA-DASLab/ [...] cussions/3

Citation :

Yes, definitely. Once we’re done with Qwen3.8-27B, we’re going to work on GSQ-RCO quantization for the flash-next model as well. Thanks for the suggestion!


 [:wark0]  

Message cité 1 fois
Message édité par the_fennec le 03-09-2026 à 19:53:38

---------------
Faudra que je teste un jour :o
n°47488
neo world
Posté le 03-09-2026 à 20:12:15  profilanswer
 

ça donnerait quelle taille avec GLM ou K3 ? :o

 Page :   1  2  3  4  5  ..  55  56  57  58  59  60  61

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)