Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
3365 connectés 

 


Je génère ...
Sondage à 3 choix possibles.
Ce sondage expirera le 20-09-2026 à 10:00




Attention si vous cliquez sur "voir les résultats" vous ne pourrez plus voter

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  54  55  56  57  58  59
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°47488
neo world
Posté le 03-09-2026 à 20:12:15  profilanswer
 

Reprise du message précédent :
ça donnerait quelle taille avec GLM ou K3 ? :o

n°47502
the_fennec
f3nn3cUs z3rd4
Posté le 03-09-2026 à 20:55:27  profilanswer
 

neo world a écrit :

ça donnerait quelle taille avec GLM ou K3 ? :o


 
12GB aussi ça serait bien.


---------------
Faudra que je teste un jour :o
n°47504
neo world
Posté le 03-09-2026 à 21:03:09  profilanswer
 

En q-1 donc :o

n°47507
lapin
Posté le 03-09-2026 à 21:14:00  profilanswer
 

Lapin à voté:
 
2.Mon portefeuille sait mieux que moi ce dont j'ai besoin. Ca va rester comme ça :(
4.Les annonces d'AMD vont probablement me pousser côté Vulkan de la force
7J'économise encore un peu et je prends du matériel déjà existant

 
J'attends les Futures Prochaines AMD RADEON RX-10990XTX avec peut-être entre 24 GO et 36 GO de VRAM de la GDDR6 ou de la GDDR7, je vois mal AMD sortir une carte graphique avec HBM3, donc ce sera de la GDDR7.

n°47512
neo world
Posté le 03-09-2026 à 21:33:29  profilanswer
 

the_fennec a écrit :

Qwen 3.8 27B GSQ RCO tested - 16GB Local LLM setup
Luke's Dev Lab
https://www.youtube.com/watch?v=jFHu6wx_TMQ
https://huggingface.co/ISTA-DASLab/ [...] Q-RCO-GGUF
 
TL;DR
Une nouvelle façon de quantizer prometteuse: un Q3_S MTP de 12GB qui tient la route sur ses benchs Blender et Godot, c'est balaise!
 
request for qwen3.8 next :love:  
https://huggingface.co/ISTA-DASLab/ [...] cussions/3

Citation :

Yes, definitely. Once we’re done with Qwen3.8-27B, we’re going to work on GSQ-RCO quantization for the flash-next model as well. Thanks for the suggestion!


 [:wark0]  


tu as fait un test sur bc250 ? Tu arrives à avoir un peu de contexte sur une seule carte (malgré l'empreinte de l'OS ^^) ?

Message cité 1 fois
Message édité par neo world le 03-09-2026 à 21:33:45
n°47516
the_fennec
f3nn3cUs z3rd4
Posté le 03-09-2026 à 22:01:04  profilanswer
 

neo world a écrit :


tu as fait un test sur bc250 ? Tu arrives à avoir un peu de contexte sur une seule carte (malgré l'empreinte de l'OS ^^) ?


 
Je viens de tester sur la 4060Ti 16GB...  
 
Le Flappy:
https://dochost.co/d/pqhstox5?v=c
 

Code :
  1. llama-server --load-mode none --flash-attn on --metrics --alias default --host 0.0.0.0 --port 8080 --jinja --chat-template-file __qwen_template_froggeric.jinja --reasoning-format deepseek --kv-unified -ctk q8_0 -ctv q8_0 -lv 4 -m Qwen3.8-27B-GSQ-RCO-IQ3_S-mtp.gguf -ngl all --ctx-size 65536 --temp 0.7 --top-p 0.95 --top-k 20 --min-p 0.0 --repeat-penalty 1.0 --presence-penalty 0.0 -b 512 -ub 128  --spec-type draft-mtp --spec-draft-n-max 2 --parallel 1 --chat-template-kwargs "{\"preserve_thinking\": true, \"reasoning_effort\": \"xhigh\"}"


 
Je suis a 65k de contexte avec MTP et il me reste bien 1GB de VRAM, je dois pouvoir monter a 100k je pense. Avec un petit --no-mmproj-offload on peut mettre la vision sur le CPU.
Par contre la vitesse ... 400 en PP, tg/s a 25 en thinking et 33 en code  :love:. Un truc marrant aussi, sans passer les kwargs, le thinking faisait 10 lignes max!
 
Je trouve que c'est pas mal du tout, je comparer avec Unsloth qui fait la même taille pour voir.


---------------
Faudra que je teste un jour :o
n°47517
M300A
Posté le 03-09-2026 à 22:03:50  profilanswer
 

speedboyz30 a écrit :

 

Tu bosses dans quoi déjà ? C'est un sacré joujou quand même !
Vous ne vouliez pas passer par du cloud ?

 

Sur des trucs :o non pas de cloud (et honnêtement, les US ne sont absolument pas des gens fréquentables)


---------------
:wq
n°47518
neo world
Posté le 03-09-2026 à 22:04:16  profilanswer
 

on (moi, je :o) veut le test avec le bc250 :D
 
Y'a moyen que j'en prenne un si c'est utilisable confortablement avec 27b . Je pense que cette taille va rester vu le bordel pour trouver une barette ou un gpu depuis un an :o

n°47520
moyen_moin​s
chat réincarné
Posté le 03-09-2026 à 22:15:54  profilanswer
 

the_fennec a écrit :

 

Je viens de tester sur la 4060Ti 16GB...

 

Le Flappy:
https://dochost.co/d/pqhstox5?v=c

 
Code :
  1. llama-server --load-mode none --flash-attn on --metrics --alias default --host 0.0.0.0 --port 8080 --jinja --chat-template-file __qwen_template_froggeric.jinja --reasoning-format deepseek --kv-unified -ctk q8_0 -ctv q8_0 -lv 4 -m Qwen3.8-27B-GSQ-RCO-IQ3_S-mtp.gguf -ngl all --ctx-size 65536 --temp 0.7 --top-p 0.95 --top-k 20 --min-p 0.0 --repeat-penalty 1.0 --presence-penalty 0.0 -b 512 -ub 128  --spec-type draft-mtp --spec-draft-n-max 2 --parallel 1 --chat-template-kwargs "{\"preserve_thinking\": true, \"reasoning_effort\": \"xhigh\"}"
 

Je suis a 65k de contexte avec MTP et il me reste bien 1GB de VRAM, je dois pouvoir monter a 100k je pense. Avec un petit --no-mmproj-offload on peut mettre la vision sur le CPU.
Par contre la vitesse ... 400 en PP, tg/s a 25 en thinking et 33 en code  :love:. Un truc marrant aussi, sans passer les kwargs, le thinking faisait 10 lignes max!

 

Je trouve que c'est pas mal du tout, je comparer avec Unsloth qui fait la même taille pour voir.


[:xp1700]

n°47521
b-tzu
Geek a toute heure...
Posté le 03-09-2026 à 22:26:08  profilanswer
 

the_fennec a écrit :


 
Le support est correct? Je pensais que c'était un Temu-like.


apparement. ils ambitionnent vraiment amazon. moi jai pas testé perso


---------------
Topic Ventes || Topic Jeux Vidéos || Topic Téléphonie (Rien pour le moment)
n°47522
moyen_moin​s
chat réincarné
Posté le 03-09-2026 à 22:32:14  profilanswer
 

Fork pour kv cache partiel offload + streaming en memoire

 

https://github.com/RaymondHuang2101 [...] -streaming

 

[:paysan]


Message édité par moyen_moins le 03-09-2026 à 23:48:21
n°47523
M300A
Posté le 03-09-2026 à 22:41:13  profilanswer
 

GLM-5.3 en mode brut :D
 


(APIServer pid=7) INFO 09-03 20:38:22 [loggers.py:310] Engine 000: Avg prompt throughput: 2678.2 tokens/s, Avg generation throughput: 175.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 16.7%, Prefix cache hit rate: 92.3%
(APIServer pid=7) INFO 09-03 20:38:22 [metrics.py:125] SpecDecoding metrics: Mean acceptance length: 3.75, Current speculative depth: 7, Accepted throughput: 128.40 tokens/s, Drafted throughput: 326.89 tokens/s, Accepted: 1284 tokens, Drafted: 3269 tokens, Per-position acceptance rate: 0.801, 0.640, 0.473, 0.355, 0.240, 0.141, 0.099, Avg Draft acceptance rate: 39.3%
(APIServer pid=7) INFO 09-03 20:38:32 [loggers.py:310] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 375.8 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 16.9%, Prefix cache hit rate: 92.3%
(APIServer pid=7) INFO 09-03 20:38:32 [metrics.py:125] SpecDecoding metrics: Mean acceptance length: 5.45, Current speculative depth: 7, Accepted throughput: 306.84 tokens/s, Drafted throughput: 482.91 tokens/s, Accepted: 3069 tokens, Drafted: 4830 tokens, Per-position acceptance rate: 0.959, 0.894, 0.778, 0.641, 0.499, 0.381, 0.296, Avg Draft acceptance rate: 63.5%
(APIServer pid=7) INFO 09-03 20:38:42 [loggers.py:310] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 440.7 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 17.1%, Prefix cache hit rate: 92.3%
(APIServer pid=7) INFO 09-03 20:38:42 [metrics.py:125] SpecDecoding metrics: Mean acceptance length: 6.39, Current speculative depth: 7, Accepted throughput: 371.77 tokens/s, Drafted throughput: 482.83 tokens/s, Accepted: 3719 tokens, Drafted: 4830 tokens, Per-position acceptance rate: 0.991, 0.955, 0.864, 0.788, 0.681, 0.593, 0.517, Avg Draft acceptance rate: 77.0%
(APIServer pid=7) INFO 09-03 20:38:52 [loggers.py:310] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 399.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 17.4%, Prefix cache hit rate: 92.3%
(APIServer pid=7) INFO 09-03 20:38:52 [metrics.py:125] SpecDecoding metrics: Mean acceptance length: 5.80, Current speculative depth: 7, Accepted throughput: 330.28 tokens/s, Drafted throughput: 481.43 tokens/s, Accepted: 3304 tokens, Drafted: 4816 tokens, Per-position acceptance rate: 0.978, 0.926, 0.821, 0.670, 0.558, 0.465, 0.384, Avg Draft acceptance rate: 68.6%
(APIServer pid=7) INFO 09-03 20:39:02 [loggers.py:310] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 413.9 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 17.6%, Prefix cache hit rate: 92.3%
(APIServer pid=7) INFO 09-03 20:39:02 [metrics.py:125] SpecDecoding metrics: Mean acceptance length: 6.03, Current speculative depth: 7, Accepted throughput: 345.28 tokens/s, Drafted throughput: 480.73 tokens/s, Accepted: 3454 tokens, Drafted: 4809 tokens, Per-position acceptance rate: 0.968, 0.889, 0.798, 0.731, 0.629, 0.550, 0.463, Avg Draft acceptance rate: 71.8%
(APIServer pid=7) INFO 09-03 20:39:12 [loggers.py:310] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 415.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 17.9%, Prefix cache hit rate: 92.3%
(APIServer pid=7) INFO 09-03 20:39:12 [metrics.py:125] SpecDecoding metrics: Mean acceptance length: 6.06, Current speculative depth: 7, Accepted throughput: 347.05 tokens/s, Drafted throughput: 480.13 tokens/s, Accepted: 3471 tokens, Drafted: 4802 tokens, Per-position acceptance rate: 0.969, 0.904, 0.834, 0.733, 0.637, 0.531, 0.452, Avg Draft acceptance rate: 72.3%


---------------
:wq
n°47524
neo world
Posté le 03-09-2026 à 22:44:47  profilanswer
 

M300A a écrit :

GLM-5.3 en mode brut :D
 


(APIServer pid=7) INFO 09-03 20:38:22 [loggers.py:310] Engine 000: Avg prompt throughput: 2678.2 tokens/s, Avg generation throughput: 175.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 16.7%, Prefix cache hit rate: 92.3%
(APIServer pid=7) INFO 09-03 20:38:22 [metrics.py:125] SpecDecoding metrics: Mean acceptance length: 3.75, Current speculative depth: 7, Accepted throughput: 128.40 tokens/s, Drafted throughput: 326.89 tokens/s, Accepted: 1284 tokens, Drafted: 3269 tokens, Per-position acceptance rate: 0.801, 0.640, 0.473, 0.355, 0.240, 0.141, 0.099, Avg Draft acceptance rate: 39.3%
(APIServer pid=7) INFO 09-03 20:38:32 [loggers.py:310] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 375.8 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 16.9%, Prefix cache hit rate: 92.3%
(APIServer pid=7) INFO 09-03 20:38:32 [metrics.py:125] SpecDecoding metrics: Mean acceptance length: 5.45, Current speculative depth: 7, Accepted throughput: 306.84 tokens/s, Drafted throughput: 482.91 tokens/s, Accepted: 3069 tokens, Drafted: 4830 tokens, Per-position acceptance rate: 0.959, 0.894, 0.778, 0.641, 0.499, 0.381, 0.296, Avg Draft acceptance rate: 63.5%
(APIServer pid=7) INFO 09-03 20:38:42 [loggers.py:310] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 440.7 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 17.1%, Prefix cache hit rate: 92.3%
(APIServer pid=7) INFO 09-03 20:38:42 [metrics.py:125] SpecDecoding metrics: Mean acceptance length: 6.39, Current speculative depth: 7, Accepted throughput: 371.77 tokens/s, Drafted throughput: 482.83 tokens/s, Accepted: 3719 tokens, Drafted: 4830 tokens, Per-position acceptance rate: 0.991, 0.955, 0.864, 0.788, 0.681, 0.593, 0.517, Avg Draft acceptance rate: 77.0%
(APIServer pid=7) INFO 09-03 20:38:52 [loggers.py:310] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 399.1 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 17.4%, Prefix cache hit rate: 92.3%
(APIServer pid=7) INFO 09-03 20:38:52 [metrics.py:125] SpecDecoding metrics: Mean acceptance length: 5.80, Current speculative depth: 7, Accepted throughput: 330.28 tokens/s, Drafted throughput: 481.43 tokens/s, Accepted: 3304 tokens, Drafted: 4816 tokens, Per-position acceptance rate: 0.978, 0.926, 0.821, 0.670, 0.558, 0.465, 0.384, Avg Draft acceptance rate: 68.6%
(APIServer pid=7) INFO 09-03 20:39:02 [loggers.py:310] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 413.9 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 17.6%, Prefix cache hit rate: 92.3%
(APIServer pid=7) INFO 09-03 20:39:02 [metrics.py:125] SpecDecoding metrics: Mean acceptance length: 6.03, Current speculative depth: 7, Accepted throughput: 345.28 tokens/s, Drafted throughput: 480.73 tokens/s, Accepted: 3454 tokens, Drafted: 4809 tokens, Per-position acceptance rate: 0.968, 0.889, 0.798, 0.731, 0.629, 0.550, 0.463, Avg Draft acceptance rate: 71.8%
(APIServer pid=7) INFO 09-03 20:39:12 [loggers.py:310] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 415.6 tokens/s, Running: 1 reqs, Waiting: 0 reqs, GPU KV cache usage: 17.9%, Prefix cache hit rate: 92.3%
(APIServer pid=7) INFO 09-03 20:39:12 [metrics.py:125] SpecDecoding metrics: Mean acceptance length: 6.06, Current speculative depth: 7, Accepted throughput: 347.05 tokens/s, Drafted throughput: 480.13 tokens/s, Accepted: 3471 tokens, Drafted: 4802 tokens, Per-position acceptance rate: 0.969, 0.904, 0.834, 0.733, 0.637, 0.531, 0.452, Avg Draft acceptance rate: 72.3%



On veut la consommation en même temps et le nombre de decibels :o
#jaloux quand même :o

n°47526
the_fennec
f3nn3cUs z3rd4
Posté le 03-09-2026 à 22:50:07  profilanswer
 

neo world a écrit :

on (moi, je :o) veut le test avec le bc250 :D
 
Y'a moyen que j'en prenne un si c'est utilisable confortablement avec 27b . Je pense que cette taille va rester vu le bordel pour trouver une barette ou un gpu depuis un an :o


 
OK, je test après!
 
 
Qwen3.8-27B-UD-IQ3_S
 
https://dochost.co/d/d6haig6o?v=c
 
En fait c'est pareil :o même vitesse.  
J'ai l'impression que le modèle Unsloth utilise un peu plus de VRAM, la je suis a 16214MB alors que l'autre était un peu au dessus de 15GB.
 
Par contre seulement 10k de produit pour l'autre et Unsloth est a 15k.


---------------
Faudra que je teste un jour :o
n°47527
M300A
Posté le 03-09-2026 à 22:51:34  profilanswer
 

neo world a écrit :


On veut la consommation en même temps et le nombre de decibels :o
#jaloux quand même :o

 

J'ai toujours pas vu la machine, j'y passe lundi pour réinstaller sur une grappe de SSD et rajouter de la ram, voir mettre deux RTX6k en plus si c'est arrivé mais je crois pas


---------------
:wq
n°47528
neo world
Posté le 03-09-2026 à 23:05:48  profilanswer
 

the_fennec a écrit :


 
OK, je test après!
 
 
Qwen3.8-27B-UD-IQ3_S
 
https://dochost.co/d/d6haig6o?v=c
 
En fait c'est pareil :o même vitesse.  
J'ai l'impression que le modèle Unsloth utilise un peu plus de VRAM, la je suis a 16214MB alors que l'autre était un peu au dessus de 15GB.
 
Par contre seulement 10k de produit pour l'autre et Unsloth est a 15k.


merci :jap:
 
It's not bad. Ca tourne confortablement (pas le jeu le modèle en ram unifiée :o) combien de contexte ?

n°47531
the_fennec
f3nn3cUs z3rd4
Posté le 03-09-2026 à 23:46:59  profilanswer
 

neo world a écrit :


merci :jap:
 
It's not bad. Ca tourne confortablement (pas le jeu le modèle en ram unifiée :o) combien de contexte ?


 
Non, mais la c'était le modèle Unsloth avec la 4060Ti
 
Qwen3.8-27B-GSQ-RCO-IQ3_S-mtp sur la BC250 (24CU!) ngl all en RPC, mais llama-server sous windows quand même.
https://dochost.co/d/ksfr6tgn?v=c
 
J'ai du passer le contexte a 32k. Mais j'ai (mal) trifouillé le mtt, ya peut être moyen de mette plus.
PP a 400, mais le tg/s est beaucoup plus bas, 10 en thinking, 11 en code.

Message cité 1 fois
Message édité par the_fennec le 03-09-2026 à 23:48:05

---------------
Faudra que je teste un jour :o
n°47532
neo world
Posté le 04-09-2026 à 00:06:36  profilanswer
 

the_fennec a écrit :


 
Non, mais la c'était le modèle Unsloth avec la 4060Ti
 
Qwen3.8-27B-GSQ-RCO-IQ3_S-mtp sur la BC250 (24CU!) ngl all en RPC, mais llama-server sous windows quand même.
https://dochost.co/d/ksfr6tgn?v=c
 
J'ai du passer le contexte a 32k. Mais j'ai (mal) trifouillé le mtt, ya peut être moyen de mette plus.
PP a 400, mais le tg/s est beaucoup plus bas, 10 en thinking, 11 en code.


y'a tellement de clones de flappy bird qui arrivent sur la plateforme qu'à mon avis ils vont devoir renomer dochost en flappyhost :o
 
merci pour ces tests :jap:

n°47533
Pipould's
Posté le 04-09-2026 à 00:18:59  profilanswer
 

neo world a écrit :


y'a tellement de clones de flappy bird qui arrivent sur la plateforme qu'à mon avis ils vont devoir renomer dochost en flappyhost :o

 

merci pour ces tests :jap:

 

C'est fou, j'ai:

 

- Un dual 3090 +32gb de ddr5. Qui va peut être pouvoir faire tourner des gros modèles
- Un Strix qui avec le llamacpp de nathan1014 devient utilisable
- Mon pc normal avec un 9070Xt et 32gb de ddr5, je vais surement pouvoir faire tourner un 27b dessus
- 2 BC250 qui vont être sous steam OS. Mais je suis sur que tu peux mettre un petit modèle en background...

 

Avant les 2 premiers me semblaient utilisable mais la avoir des modèles sur 16Gb de vram ça change la donne.

 


Je parle de truc utilisable en agentic coding ofc

n°47534
neo world
Posté le 04-09-2026 à 00:28:06  profilanswer
 

je vous répond depuis l'an de grâce 2028 où tout le monde à son agent swarm sur des téléphones. On ne sait plut trop bien comment la tradition a démarré mais il y a une moyenne de 6M de nouveaux clones de flappy bird par seconde et aucun moyen de stopper la tendance :o
 
https://external-content.duckduckgo.com/iu/?u=https%3A%2F%2Fjeanclaudelepoutre.com%2Fwp-content%2Fuploads%2F2023%2F09%2Fthaiclickfarm_nation_1.jpeg&f=1&nofb=1&ipt=2e88e99b6caf1943edd1c18da81e15a31db6bb22562cab6c4cb9e414ad17c9cb
 
:o

n°47535
neo world
Posté le 04-09-2026 à 00:29:08  profilanswer
 

Pipould's a écrit :


 
C'est fou, j'ai:
 
- Un dual 3090 +32gb de ddr5. Qui va peut être pouvoir faire tourner des gros modèles
- Un Strix qui avec le llamacpp de nathan1014 devient utilisable  
- Mon pc normal avec un 9070Xt et 32gb de ddr5, je vais surement pouvoir faire tourner un 27b dessus
- 2 BC250 qui vont être sous steam OS. Mais je suis sur que tu peux mettre un petit modèle en background...
 
Avant les 2 premiers me semblaient utilisable mais la avoir des modèles sur 16Gb de vram ça change la donne.
 
 
Je parle de truc utilisable en agentic coding ofc


je pense que t'as assez de puissance de calcul pour aller concurrencer salesforce en frontal sur la capacité de dev :o

Message cité 1 fois
Message édité par neo world le 04-09-2026 à 00:29:27
n°47536
Pipould's
Posté le 04-09-2026 à 00:32:51  profilanswer
 

neo world a écrit :


je pense que t'as assez de puissance de calcul pour aller concurrencer salesforce en frontal sur la capacité de dev :o

 

Lol

 

Tu rigoles mais avec un cap a 100usd par mois en tokens... Je dois faire ca par jour juste sur les 3090's

n°47537
neo world
Posté le 04-09-2026 à 00:36:34  profilanswer
 

j'aimerais en dire autant : 2,2M de tokens en input, 1M en output sur en gros 24h.
 
je finirai jamais de rembourser le matos. Sauf éventuellement à en faire une steambox et la louer aux gamins :o

n°47538
neo world
Posté le 04-09-2026 à 00:46:31  profilanswer
 

du coup nouveau sondage  [:gaga hurle]  :o

n°47539
M300A
Posté le 04-09-2026 à 00:53:23  profilanswer
 

J'ai mon glm qui tourne quasi autonome dans OpenCode, il a bossé pendant 3h environ pour me faire des corrélations et des rapports sur des données.

 

Je lui ai redonné quelques input sur des problèmes qu'il a identifié mais qui n'en sont pas pour qu'il affine ses livrables

 

Je le laisse de nouveau en autonomie pour la nuit, je lui ai demandé de me générer des rapports avec des fonds de carte et tout

 

C'est quand même au dessus de DS4 Flash  [:ddr555] J'imagine bien que ça se voit pas sur des tâches à la con mais sur ce genre de trucs on voit qu'on est pas dans le même monde


---------------
:wq
n°47540
neo world
Posté le 04-09-2026 à 00:57:35  profilanswer
 

M300A a écrit :

J'ai mon glm qui tourne quasi autonome dans OpenCode, il a bossé pendant 3h environ pour me faire des corrélations et des rapports sur des données.
 
Je lui ai redonné quelques input sur des problèmes qu'il a identifié mais qui n'en sont pas pour qu'il affine ses livrables
 
Je le laisse de nouveau en autonomie pour la nuit, je lui ai demandé de me générer des rapports avec des fonds de carte et tout
 
C'est quand même au dessus de DS4 Flash  [:ddr555] J'imagine bien que ça se voit pas sur des tâches à la con mais sur ce genre de trucs on voit qu'on est pas dans le même monde


j'espère qu'ils passeront aussi à une nouvelle architecture de modèle type celle de Next 4. On aurait tellement de possibilité de faire tourner des gros modèles correctement un peu sur n'importe quoi ! :D

n°47570
seu
M 41
Posté le 04-09-2026 à 09:42:18  profilanswer
 

Hello !  
 
Dans le cadre de mon métier nous utilisons de plus en plus l'IA pour divers sujets (Maitrise d'oeuvre en marché public, économie de la construction) ,  nous avons changé de matos il y a pas longtemps et je me suis motivé de récupérer des ordinateurs pas trop dégeux pour créer un LLM local.
 
en gros ça serait un proof of concept qu'on peut faire quelque chose qui fonctionne pour notre service, pour ensuite passer sur des machines plus conséquentes avec un investissement adéquat en fonction des capacités du LLM.
 
Déjà est ce que je suis sur le bon topic ?  :jap:  
 
En ce qui me concerne je suis plus que calé en hardware, c'est la partie soft qui est plus une inconnue.

n°47577
M300A
Posté le 04-09-2026 à 10:08:43  profilanswer
 

Oui c'est le bon endroit !

 

Tu dois commencer par expliquer ce que tu as comme hardware et quels sont tes besoins (relecture de doc en langues EU ?)


---------------
:wq
n°47579
seu
M 41
Posté le 04-09-2026 à 10:15:23  profilanswer
 

M300A a écrit :

Oui c'est le bon endroit !
 
Tu dois commencer par expliquer ce que tu as comme hardware et quels sont tes besoins (relecture de doc en langues EU ?)


 
Pour l'instant l'hardware n'est pas folichon :  
 
5900X , 32 Go de ram, un SSD de 500 go et une 4060 TI de 8go (avec possibilité de doubler la ram et de rajouter une 4060TI)
 
J'ai plusieurs objectifs :  créer un LLM capable d'analyser des documents de marchés public, de les analyser afin d'accélérer leur traitement (Gros PDF, excel, et DWG)
 
dans l'idée :  
 
- Qu'il soit capable de faire une base de donnée de prix tirée de nos projets
- qu'ils soit capable de rédiger des documents en fonction d'une trame donnée
- qu'il soit capable d'analyser des documents et en faire des résumés.  
 
Pour l'instant on utilise gémini Pro ou bien encore Copilot.   Mais nous travaillons de plus en plus sur de gros projet avec des NDA conséquents, et j'ai peur que bientôt on nous interdise l'utilisation de LLM pas vraiment sécurisés sur la fuite de données.

Message cité 2 fois
Message édité par seu le 04-09-2026 à 10:16:03
n°47583
M300A
Posté le 04-09-2026 à 10:21:52  profilanswer
 

Je ne suis pas spécialiste mais je pense que ça va être difficile, je ne crois pas que tu puisses faire grand chose sous les 32/64Gb de VRAM, et même si Gemini c'est de la merde, ça sera quand un même un massive downgrade

 

Mais il y a pas mal de gens qui bricolent ici et qui pourront t'en dire plus :D


---------------
:wq
n°47584
M300A
Posté le 04-09-2026 à 10:24:33  profilanswer
 

neo world a écrit :


j'espère qu'ils passeront aussi à une nouvelle architecture de modèle type celle de Next 4. On aurait tellement de possibilité de faire tourner des gros modèles correctement un peu sur n'importe quoi ! :D

 

Rapport visualisé un peu ce matin, et je comprends mieux les retours de certains collègues, il a du mal à parler d'autre chose que de code et son français est spécial  [:chevreuil_npa:3]

 

Il a aussi été paresseux avec la vision, beaucoup de cartes sont illisibles avec des overlaps un peu partout.

 

Deuxième passe en cours, je vois dans le thinking qu'il en chie :D


---------------
:wq
n°47585
seu
M 41
Posté le 04-09-2026 à 10:26:21  profilanswer
 

M300A a écrit :

Je ne suis pas spécialiste mais je pense que ça va être difficile, je ne crois pas que tu puisses faire grand chose sous les 32/64Gb de VRAM, et même si Gemini c'est de la merde, ça sera quand un même un massive downgrade
 
Mais il y a pas mal de gens qui bricolent ici et qui pourront t'en dire plus :D


 
Le but c'est d'avoir des bonnes connaissances avant de passer sur du matos adapté  :jap:  
 

n°47586
M300A
Posté le 04-09-2026 à 10:35:20  profilanswer
 

seu a écrit :

 

Le but c'est d'avoir des bonnes connaissances avant de passer sur du matos adapté  :jap:

 


 

Pour moi là ou ça commence à être sympa c'est deux RTX6000 Pro BW 96Gb. Avec ça tu peux faire tourner un DeepSeek Flash v4 0731.
C'est plus qu'utilisable, c'est good enough pour pas mal de gens.
En dessous tu vas avoir les petits Qwen, 3.8 27b dense ou 3.8 Flash Next Moe, j'ai pas regardé en détail mais là tu commence à rentrer dans la gamme de ce qui peut tourner sur deux GPU grand publics, mais ne t'attends pas à des perfs impressionnantes (particulièrement niveau vitesse, niveau savoir
 c'est encore exploitable), ni un gros contexte (ça c'est embêtant mais ça peut se contourner niveau harness en demandant un découpage propre des tâches avec sub-agent et markdown de suivi) et probablement pas d'utilisateurs simultanés.
Je ne sais pas si c'est le mieux pour des documents en non-anglais, il me semble pas con de regarder du côté de Gemma de Google, voir Mistral, voir même Muse de Facebook (je crois avoir vu que ça se débrouillait pas si mal).

 

Pour le faire tourner, une Debian, VLLM, un reverse proxy par dessus et pas de soucis. Quand c'est des cas particuliers t'as des communautés qui compilent des VLLM custom et mettent ça dans des dockers.
Tu as d'autre solution, même qui tournent sur Windows ou Mac, mais je ne touche pas à ça.


---------------
:wq
n°47587
SynE
Agri du dessert
Posté le 04-09-2026 à 10:36:37  profilanswer
 

seu a écrit :


 
Le but c'est d'avoir des bonnes connaissances avant de passer sur du matos adapté  :jap:  
 


 
Pour avoir tenté l'analyse de PDF, faut beaucoup de ram pour les gros pdf :jap:

n°47589
the_fennec
f3nn3cUs z3rd4
Posté le 04-09-2026 à 10:41:34  profilanswer
 

seu a écrit :


 
Pour l'instant l'hardware n'est pas folichon :  
 
5900X , 32 Go de ram, un SSD de 500 go et une 4060 TI de 8go (avec possibilité de doubler la ram et de rajouter une 4060TI)


 
La RAM n'est pas très utile, mais une deuxième 4060TI est un minimum pour arriver a 16Go de VRAM. Avec ça tu pourras essayer un Qwen 3.6 35B bien quantifié et faire des PoC. Mais tu auras quand même un tout petit contexte. Si tu n'as pas trop de tool calls, tu pourrais essayer un Gemma 4 en QAT.


---------------
Faudra que je teste un jour :o
n°47597
lapin
Posté le 04-09-2026 à 11:05:48  profilanswer
 

Méfiez-vous d'après Windows Defender y a pas mal de Virus dans les repos de https://github.com/ggml-org/llama.cpp/releases
Après bon ce ne sont peut-être que de faux positifs, mais Windows Defender à envoyer les fichiers dans le Cloud Antivirus de Microsoft, puis une seconde fois à carément supprimer certains fichiers.

n°47599
seu
M 41
Posté le 04-09-2026 à 11:08:57  profilanswer
 

M300A a écrit :


 
Pour moi là ou ça commence à être sympa c'est deux RTX6000 Pro BW 96Gb. Avec ça tu peux faire tourner un DeepSeek Flash v4 0731.
C'est plus qu'utilisable, c'est good enough pour pas mal de gens.
En dessous tu vas avoir les petits Qwen, 3.8 27b dense ou 3.8 Flash Next Moe, j'ai pas regardé en détail mais là tu commence à rentrer dans la gamme de ce qui peut tourner sur deux GPU grand publics, mais ne t'attends pas à des perfs impressionnantes (particulièrement niveau vitesse, niveau savoir
 c'est encore exploitable), ni un gros contexte (ça c'est embêtant mais ça peut se contourner niveau harness en demandant un découpage propre des tâches avec sub-agent et markdown de suivi) et probablement pas d'utilisateurs simultanés.
Je ne sais pas si c'est le mieux pour des documents en non-anglais, il me semble pas con de regarder du côté de Gemma de Google, voir Mistral, voir même Muse de Facebook (je crois avoir vu que ça se débrouillait pas si mal).
 
Pour le faire tourner, une Debian, VLLM, un reverse proxy par dessus et pas de soucis. Quand c'est des cas particuliers t'as des communautés qui compilent des VLLM custom et mettent ça dans des dockers.
Tu as d'autre solution, même qui tournent sur Windows ou Mac, mais je ne touche pas à ça.


 
ça roule, merci pour les infos  :jap:  
 

SynE a écrit :


 
Pour avoir tenté l'analyse de PDF, faut beaucoup de ram pour les gros pdf :jap:


 
Ok ! le but c'est de tester au début, même si ça risque de bien ramer.
 

the_fennec a écrit :


 
La RAM n'est pas très utile, mais une deuxième 4060TI est un minimum pour arriver a 16Go de VRAM. Avec ça tu pourras essayer un Qwen 3.6 35B bien quantifié et faire des PoC. Mais tu auras quand même un tout petit contexte. Si tu n'as pas trop de tool calls, tu pourrais essayer un Gemma 4 en QAT.


 
Dans l'idée je peux entrainer un LLM et le faire évoluer de plateforme en plateforme en fonction des performances ?

n°47604
moyen_moin​s
chat réincarné
Posté le 04-09-2026 à 11:20:07  profilanswer
 

y'a eu des poc de streaming du cache kv depuis la RAM, ça évite que la génération se casse la gueule.
vaut mieux avoir un peu de RAM donc à l'avenir. :o

n°47639
the_fennec
f3nn3cUs z3rd4
Posté le 04-09-2026 à 14:27:47  profilanswer
 

seu a écrit :


Dans l'idée je peux entrainer un LLM et le faire évoluer de plateforme en plateforme en fonction des performances ?


 
Faire de l'inférence avec une (ou deux) 4060ti 8GB c'est chaud, alors faire du training, il va falloir être très patient :o


---------------
Faudra que je teste un jour :o
n°47641
seu
M 41
Posté le 04-09-2026 à 14:52:17  profilanswer
 

the_fennec a écrit :


 
Faire de l'inférence avec une (ou deux) 4060ti 8GB c'est chaud, alors faire du training, il va falloir être très patient :o


 
je ne suis pas pressé. Mais je peux avoir des 3090, ça serait peut être mieux non ?  :D

n°47642
SynE
Agri du dessert
Posté le 04-09-2026 à 15:02:16  profilanswer
 

Carrément mieux :o

 Page :   1  2  3  4  5  ..  54  55  56  57  58  59

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)