Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
3964 connectés 

 


Je génère ...
Sondage à 3 choix possibles.
Ce sondage expirera le 20-09-2026 à 10:00




Attention si vous cliquez sur "voir les résultats" vous ne pourrez plus voter

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  65  66  67  68  69  70
Page Suivante
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°49586
neo world
Posté le 17-09-2026 à 20:35:23  profilanswer
 

Reprise du message précédent :
Je veux bien vos liens :D
 
Mais pourquoi pas une 6090 64GO au prix de la 5090 32 GO …  [:stylken:4]

n°49587
tfpsly
Sly
Posté le 17-09-2026 à 20:37:01  profilanswer
 

tfpsly a écrit :


Ici je vois plutôt 250 à 300 balles pour un setup complet.
J'ai choppé ma 3060 12gb pour 100 CHF. Mais juste avant la vague de folie. Elle semble valoir dans les 200.- actuellement.
Aujourd'jui je mettrais 250.- pour la remplacer par une 5060 Ti 16gb; pas pour prendre moins puissant.

 

Certes je compares un upgrade GPU vs un système "complet" qui tournerait h24 dans la salle technique.


5060 Ti 16gb 460 CHF reçue. Driver Nv et llama-server réinstallés.
- Comparaison rapide avec ma 3060 12gb - base line : max 45tk/s (preprocess 380tk/s)
- Avec la même ligne de commande : max 61tk/s (preprocess 600tk/s).
- en optimisant rapidement pour les 16gb : max 60tk/s (preprocess 890tk/s).

 

- premier essai avec Qwen3.8-27B-i1-IQ4_XS-GGUF-Smaller et 32k de contexte : 19tk/s (preprocess 380tk/s)
- à peaufiner...


Message édité par tfpsly le 17-09-2026 à 20:37:49
n°49588
AllenMadis​on
Oracle du Keb's
Posté le 17-09-2026 à 20:39:52  profilanswer
 

neo world a écrit :

Je veux bien vos liens :D
 
Mais pourquoi pas une 6090 64GO au prix de la 5090 32 GO …  [:stylken:4]


 
T'es pas le seul  [:rage_anormale]


---------------
Nothing much to teach, man. There's ze high, there's ze low and yall still fucking miss.
n°49589
AllenMadis​on
Oracle du Keb's
Posté le 17-09-2026 à 20:43:57  profilanswer
 

sardhaukar a écrit :


Merci pour ce bel accueil.  [:sniperr]

 

Contexte : Je suis ingé IT à l'INFRA d'une multinationale et forcément on nage en plein dans l'adoption de l'IA comme un peu partout j'imagine. Mon rôle est d'identifier les cas d’usage IA à valeur ajoutée, prototyper/industrialiser les bons usages, accompagner l’adoption et mesurer les gains.

 

Là où je suis on ne travaille qu'avec des modèles Frontier US et ça me frustre un peu. La vague Open Weight arrivée cette année m'a donné envie de mettre les mains sous le capot, de tout comprendre, de tout maitriser pour pouvoir proposer d'autres solutions.

 

J'ai commencé à bricoler avec ma machine gaming en RTX 3080 12G mais pour un environnement agentique orchestré c'est un peu juste donc je viens tout juste d'acheter un Macbook M1 Max 64GB (pauvritude relative inside) et là je vais commencer par travailler sur le fine tuning de petits modèles donc création de datasets puis FT QLora, observations après 1 epoch, 2 epochs, 3 epochs etc etc.

 

A terme je pense que les entreprises vont avoir besoin de gars qui gèrent l'installation d'infra IA/parametres etc, et le tout en local donc oui c'est le bon moment pour s'y mettre

 

Pour l'instant c'est le début, y'a un rush dessus, mais ce qu'il va manquer c'est des gens qui sachent monter une vraie infra IA pour le local et il y aura une sacrée demande.

 

Par contre l'inconvénient c'est que ça évolue très vite, toutes les 2 semaines il y a un nouveau modèle, plus perf, plus opti, plus... Mais oui un chef de projet infra IA, qui sache configurer, monter les clusters, qui sache bien adapter à la demande et qui a une bonne idée de ce qu'il faut comme capacités pour un truc potable, ça va devenir nécessaire.


Message édité par AllenMadison le 17-09-2026 à 20:45:38

---------------
Nothing much to teach, man. There's ze high, there's ze low and yall still fucking miss.
n°49591
the_fennec
f3nn3cUs z3rd4
Posté le 17-09-2026 à 20:52:20  profilanswer
 

AllenMadison a écrit :

rumeur de nvidia qui sortirait ses cartes graphiques pour 2027, avec possiblement de la ram en quantité.  
 
ça vient de mlid, nvidia a laissé les lab IA se fill en puces mémoire, et apparemment le GO aurait été donné pour les cartes graphiques de nvidia pour H1 2027, nouvelle génération.  
 
Possible aussi qu'il y ait des améliorations du design du gpu grâce à l'ia


 
OSEF, ça va être encore plus chère que le peu de ce qui est dispo, avec moins de VRAM.
https://tech.sportskeeda.com/gaming [...] er-reports


---------------
Faudra que je teste un jour :o
n°49593
neo world
Posté le 17-09-2026 à 22:10:23  profilanswer
 

perso j'ai aucun espoir avant l'arrivée de la DDR7 et plutôt sous forme de respiration du "vieux"matos rendu obsolète (jusqu'au mac M5 / DGX 10 / Halo strix / medusa, Xiaomi ai box ...) qu'une grosse baisse de prix générale.
 
Ou alors le chateau de carte de l'IA s'effondre et ce sera la foire à la saucisse du DGX100 à des prix abordables. Mais je ne crois pas à un effondrement. éventuellement une longue repiration. Aucun état ne laissera tomber son champion et les GAFAMS n'auront aucun problème à remettre au pot commun
 
bref ne rangez pas votre scotch et vos nappes pATA : ça va servir encore un moment :o

Message cité 1 fois
Message édité par neo world le 17-09-2026 à 22:11:13
n°49594
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 17-09-2026 à 22:22:26  profilanswer
 

neo world a écrit :

perso j'ai aucun espoir avant l'arrivée de la DDR7 et plutôt sous forme de respiration du "vieux"matos rendu obsolète (jusqu'au mac M5 / DGX 10 / Halo strix / medusa, Xiaomi ai box ...) qu'une grosse baisse de prix générale.
 
Ou alors le chateau de carte de l'IA s'effondre et ce sera la foire à la saucisse du DGX100 à des prix abordables. Mais je ne crois pas à un effondrement. éventuellement une longue repiration. Aucun état ne laissera tomber son champion et les GAFAMS n'auront aucun problème à remettre au pot commun
 
bref ne rangez pas votre scotch et vos nappes pATA : ça va servir encore un moment :o


 
Ca parle de moi ? :O


---------------
Victime de girafophobie, mais se soigne.
n°49597
the_fennec
f3nn3cUs z3rd4
Posté le 17-09-2026 à 23:14:35  profilanswer
 

PrismML a sortis son Ternary-Bonsai-2-27B-gguf basé sur qwen 3.8 27B:
https://huggingface.co/prism-ml/Ter [...] 2-27B-gguf
Il faut leur fork de llama.cpp:
https://github.com/PrismML-Eng/llama.cpp/releases
 
Le TQ1 fais moins de 6GB :pt1cable:


---------------
Faudra que je teste un jour :o
n°49598
neo world
Posté le 17-09-2026 à 23:30:10  profilanswer
 

Ils font des des versions de deepseek flash 4.1 avec ça ? :D

n°49599
the_fennec
f3nn3cUs z3rd4
Posté le 17-09-2026 à 23:41:21  profilanswer
 

Non que 27B :(


---------------
Faudra que je teste un jour :o
n°49600
neo world
Posté le 18-09-2026 à 00:01:43  profilanswer
 


ça fait un chouette point d'entrée si ça tient ses promesses d’efficacité vs le BF16 original
 
@lapin voilà un truc à tester avec ton demi GPU de l'enfer :o

n°49601
lapin
Posté le 18-09-2026 à 00:12:44  profilanswer
 

neo world a écrit :


ça fait un chouette point d'entrée si ça tient ses promesses d’efficacité vs le BF16 original
 
@lapin voilà un truc à tester avec ton demi GPU de l'enfer :o


 
 
Ouais mais moi j'ai le HBCC t'vois  [:barracus:4]   !!!

n°49606
Olivie
SUUUUUUUUUUUUUU
Posté le 18-09-2026 à 05:42:21  profilanswer
 

the_fennec a écrit :

PrismML a sortis son Ternary-Bonsai-2-27B-gguf basé sur qwen 3.8 27B:
https://huggingface.co/prism-ml/Ter [...] 2-27B-gguf
Il faut leur fork de llama.cpp:
https://github.com/PrismML-Eng/llama.cpp/releases
 
Le TQ1 fais moins de 6GB :pt1cable:


 
Mon MBP M1 16Go pas assez puissant ? :o :(
 

Citation :


Failed to load the model
 
Failed to load model.
 
error loading model: llama_model_loader: failed to load model from /Users/xxxx/.lmstudio/models/prism-ml/Ternary-Bonsai-2-27B-gguf/Ternary-Bonsai-2-27B-PTQ1_0.gguf


 

Citation :

@atomic_chat_hq
 
Run Bonsai 27B locally on a 16 GB Mac  

Bonsai 2 27B is @PrismML's ternary build of Qwen3.8 27B that keeps 98.2% of FP16 quality in 7 GB, it made a voxel Japanese pagoda in one prompt with Three.js!

Message cité 1 fois
Message édité par Olivie le 18-09-2026 à 06:17:51

---------------

n°49610
tfpsly
Sly
Posté le 18-09-2026 à 08:16:56  profilanswer
 

the_fennec a écrit :

PrismML a sortis son Ternary-Bonsai-2-27B-gguf basé sur qwen 3.8 27B:
https://huggingface.co/prism-ml/Ter [...] 2-27B-gguf
Il faut leur fork de llama.cpp:
https://github.com/PrismML-Eng/llama.cpp/releases
 
Le TQ1 fais moins de 6GB :pt1cable:


La vache !
Par contre ça dégraderait vachement ses scores de logique : https://www.reddit.com/r/LocalLLaMA [...] b_1bit_on/
https://preview.redd.it/i-ran-ternary-bonsai-27b-2-bit-and-bonsai-27b-1-bit-on-v0-315dccgwageh1.jpeg?width=1080&crop=smart&auto=webp&s=1d963c94bbbe155a5794f96ab80143230fe45f66

n°49613
the_fennec
f3nn3cUs z3rd4
Posté le 18-09-2026 à 08:43:22  profilanswer
 

Olivie a écrit :


 
Mon MBP M1 16Go pas assez puissant ? :o :(
 

Citation :


Failed to load the model
 
Failed to load model.
 
error loading model: llama_model_loader: failed to load model from /Users/xxxx/.lmstudio/models/prism-ml/Ternary-Bonsai-2-27B-gguf/Ternary-Bonsai-2-27B-PTQ1_0.gguf


 

Citation :

@atomic_chat_hq
 
Run Bonsai 27B locally on a 16 GB Mac  

Bonsai 2 27B is @PrismML's ternary build of Qwen3.8 27B that keeps 98.2% of FP16 quality in 7 GB, it made a voxel Japanese pagoda in one prompt with Three.js!



 
T'as lu mon post en entier?


---------------
Faudra que je teste un jour :o
n°49614
the_fennec
f3nn3cUs z3rd4
Posté le 18-09-2026 à 08:44:40  profilanswer
 


 
Oui, avec un modèle si petit, c'est juste un exploit d'avoir un truc qui fonctionne!


---------------
Faudra que je teste un jour :o
n°49617
tfpsly
Sly
Posté le 18-09-2026 à 08:53:39  profilanswer
 

Qwen 3.8 25tk/s (preprocess 960tk/s) en Q5 sur 5060Ti:

Code :
  1. llama-server -m ~/models/Qwen3.8-27B-i1-IQ4_XS-GGUF-Smaller.gguf -c 65536 -b 512 -ub 512 -ngl 99 --flash-attn on --cache-type-k q5_1 --cache-type-v q5_1 --port 8080
 

27tk/s en Q4 - le gain est faible, la bande passante de la VRAM est le facteur limitant je reste en Q5 pour le moment :

Code :
  1. llama-server -m ~/models/Qwen3.8-27B-i1-IQ4_XS-GGUF-Smaller.gguf -c 65536 -b 512 -ub 512 -ngl 99 --flash-attn on --cache-type-k q4_0 --cache-type-v q4_0 --port 8080


Message édité par tfpsly le 18-09-2026 à 09:21:10
n°49625
sardhaukar
Posté le 18-09-2026 à 09:11:45  profilanswer
 

neo world a écrit :

Je veux bien vos liens :D
 
Mais pourquoi pas une 6090 64GO au prix de la 5090 32 GO …  [:stylken:4]


Au prix de maintenant ou au prix public au lancement ? J'ai du mal à croire à quelque chose de plus accessible étant donné ce que je vois dans le secteur de la téléphonie cette année mais sait-on jamais...  [:canaille]

n°49626
moyen_moin​s
chat réincarné
Posté le 18-09-2026 à 09:20:14  profilanswer
 

the_fennec a écrit :

PrismML a sortis son Ternary-Bonsai-2-27B-gguf basé sur qwen 3.8 27B:
https://huggingface.co/prism-ml/Ter [...] 2-27B-gguf
Il faut leur fork de llama.cpp:
https://github.com/PrismML-Eng/llama.cpp/releases

 

Le TQ1 fais moins de 6GB :pt1cable:


La qualité de ces modèles cependant [:paysan]
Le Qwen 3.8 gsq rco par contre, vu la taille je suis plutôt surpris des résultats.

n°49627
the_fennec
f3nn3cUs z3rd4
Posté le 18-09-2026 à 09:46:18  profilanswer
 

moyen_moins a écrit :


La qualité de ces modèles cependant [:paysan]
Le Qwen 3.8 gsq rco par contre, vu la taille je suis plutôt surpris des résultats.


 
Je suis pas encore convaincu pas les gsq rco, j'ai des trucs un peu zrab avec Qwen Next. Pour le moment j'essaye de retrouver la config qui me faisait passer les 100/s en PP, en génération par contre je suis a 16/17 ce qui est pas mal du tout.


---------------
Faudra que je teste un jour :o
n°49635
Olivie
SUUUUUUUUUUUUUU
Posté le 18-09-2026 à 10:59:08  profilanswer
 

the_fennec a écrit :


 
T'as lu mon post en entier?


Évidemment que j’ai lu.
Je ne l’ai pas compris mais j’ai lu :o
Quand je rentre je demanderai une traduction à ChatGPT


---------------

n°49636
moyen_moin​s
chat réincarné
Posté le 18-09-2026 à 11:12:23  profilanswer
 

the_fennec a écrit :

 

Je suis pas encore convaincu pas les gsq rco, j'ai des trucs un peu zrab avec Qwen Next. Pour le moment j'essaye de retrouver la config qui me faisait passer les 100/s en PP, en génération par contre je suis a 16/17 ce qui est pas mal du tout.


j'ai pas encore testé le qwen next gsq rco, que le 3.8 27B :jap:
pour ce à quoi je m'en suis servi, le résultat est pas si mal pour 12Go :)

Message cité 1 fois
Message édité par moyen_moins le 18-09-2026 à 11:13:30
n°49637
tfpsly
Sly
Posté le 18-09-2026 à 11:16:45  profilanswer
 

Qwen 3.8 en MTP qui tourne à 45 tk/s (preprompt 870 tk/s) sur ma 5060 Ti :o

 

Par contre je ne peux plus avoir de navigateur ouvert; moins de 400mb de VRAM dispo.

 

https://www.reddit.com/r/LocalLLM/c [...] ingle_rtx/
Model : https://huggingface.co/Bucoid/Qwen3 [...] -VRAM-GGUF

Code :
  1. llama-server -m ~/models/Qwen3.8-27B-Uncensored-IQ4_XS_4BPW.gguf -c 24576 -b 128 -ub 128 -ngl 38 --flash-attn on --cache-type-k q4_0 --cache-type-v q4_0 --spec-type draft-mtp --spec-draft-n-max 2 --no-context-shift --port 8080

Message cité 1 fois
Message édité par tfpsly le 18-09-2026 à 12:20:04
n°49639
the_fennec
f3nn3cUs z3rd4
Posté le 18-09-2026 à 11:33:18  profilanswer
 

Olivie a écrit :


Évidemment que j’ai lu.
Je ne l’ai pas compris mais j’ai lu :o
Quand je rentre je demanderai une traduction à ChatGPT


 
Il faut utiliser leur fork de llama.cpp.


---------------
Faudra que je teste un jour :o
n°49642
the_fennec
f3nn3cUs z3rd4
Posté le 18-09-2026 à 11:41:11  profilanswer
 

moyen_moins a écrit :


j'ai pas encore testé le qwen next gsq rco, que le 3.8 27B :jap:
pour ce à quoi je m'en suis servi, le résultat est pas si mal pour 12Go :)


 
C'est pas mal, mais j'ai du mal a bien répartir mes layers.
 

tfpsly a écrit :

Qwen 3.8 en MTP qui tourne à 45 tk/s (preprompt 870 tk/s) sur ma 5060 Ti :o
 
Par contre je ne peux plus avoir de navigateur ouvert; moins de 400mb de VRAM dispo.
 
https://www.reddit.com/r/LocalLLM/c [...] ingle_rtx/
Model : https://huggingface.co/Bucoid/Qwen3 [...] -VRAM-GGUF

Code :
  1. llama-server -m ~/models/Qwen3.8-27B-Uncensored-IQ4_XS_4BPW.gguf -c 24576 -b 128 -ub 128 -ngl 38 --flash-attn --cache-type-k q4_0 --cache-type-v q4_0 --spec-type draft-mtp --spec-draft-n-max 2 --no-context-shift --port 8080



 
Si tu désactives l'accélération hardware (testé avec Firefox) ça n'utilise plus de VRAM.


---------------
Faudra que je teste un jour :o
n°49646
tfpsly
Sly
Posté le 18-09-2026 à 12:20:55  profilanswer
 

the_fennec a écrit :


Si tu désactives l'accélération hardware (testé avec Firefox) ça n'utilise plus de VRAM.


Effectivement. J'y avais pensé, mais je l'avais juste fermer, vu que je suis sur le laptop du bureau en parallèle.

 

La commande au dessus est instable; trop proche de 100% de toute la VRAM, et parfois ça ne se lance pas (fragmentation de la VRAM je suppose).
Une meilleure commande, et avec 32k de contexte, jusque 55 tk/s (prompt preproces 850 tk/s) :

Code :
  1. llama-server -m ~/models/Qwen3.8-27B-Uncensored-IQ4_XS_4BPW.gguf -c 32768 --parallel 1 -b 512 -ub 512 -ngl 99 --flash-attn on --cache-type-k q4_0 --cache-type-v q4_0 --spec-type draft-mtp --spec-draft-n-max 2 --fit off --reasoning off --reasoning-budget 0 --chat-template-kwargs '{"reasoning_effort":"none"}' --port 8080


Message édité par tfpsly le 18-09-2026 à 13:38:59
n°49652
moyen_moin​s
chat réincarné
Posté le 18-09-2026 à 13:22:33  profilanswer
 

the_fennec a écrit :


 
C'est pas mal, mais j'ai du mal a bien répartir mes layers.
 


c'est vraiment le genre de truc dont je m'occupe pas quand je teste ave lmstudio, je crois que d'ailleurs pas avoir le choix : split evenly en vulkan [:transparency]  

the_fennec a écrit :


 
Si tu désactives l'accélération hardware (testé avec Firefox) ça n'utilise plus de VRAM.


j'avoue que Firefox pompe bien dans la VRAM, faut que j'essaie sans l'activation HW (quand je charge trop la VRAM, ça finit par planter les vidéos sous firefox par exemple) [:transparency]

n°49656
lapin
Posté le 18-09-2026 à 13:37:45  profilanswer
 

moyen_moins a écrit :


c'est vraiment le genre de truc dont je m'occupe pas quand je teste ave lmstudio, je crois que d'ailleurs pas avoir le choix : split evenly en vulkan [:transparency]  


 

moyen_moins a écrit :


j'avoue que Firefox pompe bien dans la VRAM, faut que j'essaie sans l'activation HW (quand je charge trop la VRAM, ça finit par planter les vidéos sous firefox par exemple) [:transparency]


 
 
Je ne sais pas si c'est votre cas, mais quand je désactive l'accélération HW dans Google Chrome, les vidéos Youtube par exemple sont hyper saccader.

n°49657
tfpsly
Sly
Posté le 18-09-2026 à 14:04:10  profilanswer
 

lapin a écrit :

Je ne sais pas si c'est votre cas, mais quand je désactive l'accélération HW dans Google Chrome, les vidéos Youtube par exemple sont hyper saccader.


Dans Firefox/Linux, en 2160P ça passe encore. YT 4K choppe un peu.

 

Vraiment surpris par la dernière ligne de commande suggérée par Gemini (au dessus puis modifiée à la main) : contexte de 34k (32k dans le settings.json de pi.dev, parce qu'il envoie parfois des requête plus larges); ça tient intégralement en VRAM (15025MiB /  16311MiB); et maintenant il me reste 1gb de VRAM (je devrais pouvoir remettre l'accélération hw dans Firefox).
Vraiment très agréablement surpris par le couple 5060Ti + Qwen3.8-27B-Uncensored-IQ4_XS. Jusque 60 tk/s (930 tk/s en prompt preprocess).

Code :
  1. llama-server -m ~/models/Qwen3.8-27B-Uncensored-IQ4_XS_4BPW.gguf -c 65536 --parallel 1 -b 512 -ub 512 -ngl 99 --flash-attn on --cache-type-k q4_0 --cache-type-v q4_0 --spec-type draft-mtp --spec-draft-n-max 2 --fit off --reasoning off --reasoning-budget 0 --chat-template-kwargs '{"reasoning_effort":"none"}' --port 8080
  2. 2.48.930.677 I slot print_timing: id  0 | task 4110 | n_gen =    357, tg =  59.19 t/s, tg_3s =  57.53 t/s
  3. 12.51.930.931 I slot print_timing: id  0 | task 4110 | n_gen =    536, tg =  59.34 t/s, tg_3s =  59.66 t/s
  4. 12.54.948.577 I slot print_timing: id  0 | task 4110 | n_gen =    719, tg =  59.67 t/s, tg_3s =  60.64 t/s
  5. 12.57.965.153 I slot print_timing: id  0 | task 4110 | n_gen =    893, tg =  59.27 t/s, tg_3s =  57.68 t/s
  6. 13.01.017.010 I slot print_timing: id  0 | task 4110 | n_gen =   1059, tg =  58.45 t/s, tg_3s =  54.39 t/s
  7. 13.04.022.646 I slot print_timing: id  0 | task 4110 | n_gen =   1234, tg =  58.42 t/s, tg_3s =  58.22 t/s
  8. 13.07.048.684 I slot print_timing: id  0 | task 4110 | n_gen =   1412, tg =  58.47 t/s, tg_3s =  58.82 t/s
  9. 13.10.052.396 I slot print_timing: id  0 | task 4110 | n_gen =   1556, tg =  57.30 t/s, tg_3s =  47.94 t/s
  10. 13.13.075.272 I slot print_timing: id  0 | task 4110 | n_gen =   1730, tg =  57.33 t/s, tg_3s =  57.56 t/s
  11. 13.16.103.212 I slot print_timing: id  0 | task 4110 | n_gen =   1913, tg =  57.61 t/s, tg_3s =  60.44 t/s
  12. 13.19.150.056 I slot print_timing: id  0 | task 4110 | n_gen =   2096, tg =  57.82 t/s, tg_3s =  60.06 t/s
  13. 13.20.737.651 I slot print_timing: id  0 | task 4110 | prompt eval time =    5490.47 ms /  4576 tokens (    1.20 ms per token,   833.44 tokens per second)
  14. 13.20.737.654 I slot print_timing: id  0 | task 4110 |        eval time =   37821.86 ms /  2181 tokens (   17.35 ms per token,    57.64 tokens per second)
  15. 13.20.737.655 I slot print_timing: id  0 | task 4110 |       total time =   43312.33 ms /  6757 tokens
  16. 13.20.737.656 I slot print_timing: id  0 | task 4110 |    graphs reused =       4144
  17. 13.20.737.659 I slot print_timing: id  0 | task 4110 | draft acceptance = 0.92484 ( 1415 accepted /  1530 generated), mean len =  2.85
  18. 13.20.737.914 I slot      release: id  0 | task 4110 | stop processing: n_tokens = 6756, truncated = 0
  19. 13.20.961.686 I slot get_availabl: id  0 | task -1 | selected slot by LRU, t_last = 20664784154
  20. 13.21.410.399 I slot launch_slot_: id  0 | task 4887 | processing task, is_child = 0
  21. 13.24.660.386 I slot print_timing: id  0 | task 4887 | prompt processing, n_tokens =   2890, progress = 0.09, t =   3.03 s / 953.85 tokens per second
  22. 13.25.219.095 I slot print_timing: id  0 | task 4887 | prompt processing, n_tokens =   3402, progress = 0.10, t =   3.59 s / 948.49 tokens per second
  23. 13.25.779.167 I slot print_timing: id  0 | task 4887 | prompt processing, n_tokens =   3914, progress = 0.12, t =   4.15 s / 943.94 tokens per second
  24. 13.26.341.122 I slot print_timing: id  0 | task 4887 | prompt processing, n_tokens =   4426, progress = 0.13, t =   4.71 s / 940.14 tokens per second
  25. 13.26.903.776 I slot print_timing: id  0 | task 4887 | prompt processing, n_tokens =   4938, progress = 0.15, t =   5.27 s / 936.87 tokens per second
  26. 13.27.469.491 I slot print_timing: id  0 | task 4887 | prompt processing, n_tokens =   5450, progress = 0.16, t =   5.84 s / 933.96 tokens per second
  27. 13.28.035.036 I slot print_timing: id  0 | task 4887 | prompt processing, n_tokens =   5962, progress = 0.18, t =   6.40 s / 931.60 tokens per second
  28. 13.28.603.451 I slot print_timing: id  0 | task 4887 | prompt processing, n_tokens =   6474, progress = 0.19, t =   6.97 s / 929.28 tokens per second
 

EDIT - context size 65536 passe encore mieux; moins d'échec/retry dans pi.dev

Message cité 1 fois
Message édité par tfpsly le 18-09-2026 à 16:48:58
n°49659
the_fennec
f3nn3cUs z3rd4
Posté le 18-09-2026 à 14:23:49  profilanswer
 

tfpsly a écrit :


Vraiment surpris par la dernière ligne de commande suggérée par Gemini (au dessus puis modifiée à la main) : contexte de 34k (32k dans le settings.json de pi.dev, parce qu'il envoie parfois des requête plus larges); ça tient intégralement en VRAM (15025MiB /  16311MiB); et maintenant il me reste 1gb de VRAM (je devrais pouvoir remettre l'accélération hw dans Firefox).
Vraiment très agréablement surpris par le couple 5060Ti + Qwen3.8-27B-Uncensored-IQ4_XS. Jusque 60 tk/s (930 tk/s en prompt preprocess).
[/code]


 
Tu parles de --fit off? Pour info -b 512 prends en RAM et -ub 512 en VRAM.


---------------
Faudra que je teste un jour :o
n°49660
tfpsly
Sly
Posté le 18-09-2026 à 14:39:06  profilanswer
 

the_fennec a écrit :

 

Tu parles de --fit off? Pour info -b 512 prends en RAM et -ub 512 en VRAM.


Je crois que c'est surtout l'ajout de --parallel 1 qui a sauvé de la VRAM. Je croyais que c'est la valeur par défaut; mais non, llama-server calcule automatiquement sa valeur. Là à 1, ça force à n'allouer que pour un seul contexte.

 

OK pour un usage seul; pas pour partager un modèle entre plusieurs utilisateurs ou usage (ex, coder et avoir un chatbot dans le browser).

 

Par contre, Qwen3.8 utilise plus de contexte que 3.6 (plus de réflexions), et il faut compacter le contexte plus souvent.


Message édité par tfpsly le 18-09-2026 à 14:42:21
n°49662
the_fennec
f3nn3cUs z3rd4
Posté le 18-09-2026 à 14:50:46  profilanswer
 

Ha oui, -p 1, c'est 4 par défaut il me semble.


---------------
Faudra que je teste un jour :o
n°49666
Olivie
SUUUUUUUUUUUUUU
Posté le 18-09-2026 à 15:51:31  profilanswer
 

the_fennec a écrit :


 
Il faut utiliser leur fork de llama.cpp.


 :jap:


---------------

n°49669
Fredouye
Shivers !
Posté le 18-09-2026 à 17:41:13  profilanswer
 

768gb vram for less than the price of one RTX 6000
 

Citation :

Here's my latest build, 12x64gb cmp170hx. For less than 1 RTX 6000 pro costs. I also have it connected with fiber to my other rig for RPC when I need more memory. I haven't been posting much since I built this rig, because it's now more fun to talk to my machine. I run GLM5.3, DSv4.1Flash, Qwen3.8Flash, Qwen3.8-2.4T, KimiK3 and MiniMaxM3. Performance is great, a single RTX 6000 or M3 Mac Studio wish they could. Inference with vllm or llama.cpp


 
https://preview.redd.it/768gb-vram-for-less-than-the-price-of-one-rtx-6000-v0-dunixwu6caqh1.jpg?width=1080&crop=smart&auto=webp&s=b8f72698dacda62f7d319a51087bf7c1ad735be5
 
https://preview.redd.it/768gb-vram-for-less-than-the-price-of-one-rtx-6000-v0-glpcbg5cbaqh1.jpg?width=1080&crop=smart&auto=webp&s=acfdc1b1ff52a018008e1cf07a97eab9fa5548fd


---------------
Le dernier arrivé est fan de Phil Collins
n°49670
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 18-09-2026 à 17:48:47  profilanswer
 

Trop propre, pas assez diy, ca manque de scotch, recalé :O


---------------
Victime de girafophobie, mais se soigne.
n°49676
the_fennec
f3nn3cUs z3rd4
Posté le 18-09-2026 à 18:43:18  profilanswer
 

Fredouye a écrit :

768gb vram for less than the price of one RTX 6000
 

Citation :

Here's my latest build, 12x64gb cmp170hx. For less than 1 RTX 6000 pro costs. I also have it connected with fiber to my other rig for RPC when I need more memory. I haven't been posting much since I built this rig, because it's now more fun to talk to my machine. I run GLM5.3, DSv4.1Flash, Qwen3.8Flash, Qwen3.8-2.4T, KimiK3 and MiniMaxM3. Performance is great, a single RTX 6000 or M3 Mac Studio wish they could. Inference with vllm or llama.cpp


 
https://preview.redd.it/768gb-vram- [...] c1ad735be5
 
https://preview.redd.it/768gb-vram- [...] b9fa5548fd


 
Mais biensur 12x3k ça fait déjà 36k rien que pour les cmp170hx ... (j'ai pris le prix sur ebay).
 
 [:gregosv]


---------------
Faudra que je teste un jour :o
n°49678
neo world
Posté le 18-09-2026 à 19:21:18  profilanswer
 

fallait juste acheter avant que les prix grimpent  [:logicsystem360:5] :o

n°49680
Pipould's
Posté le 18-09-2026 à 20:00:53  profilanswer
 

Le mec a clairement pecho ses 170 AVANT LA HYPE du model.

n°49702
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 19-09-2026 à 00:48:10  profilanswer
 

C'est du W3BCOUD donc ouais clairement c'etait un gros rig de minage acheté à l'époque :D


---------------
Victime de girafophobie, mais se soigne.
n°49715
tfpsly
Sly
Posté le 19-09-2026 à 11:35:35  profilanswer
 

Un Redditeur a comparé Claude Sonnet 5, Claude Opus 4.6 et Qwen 3.8 27B sur un bench. Qwen est derrière, mais pas dégueulasse !
https://www.reddit.com/r/LocalLLaMA [...] de_review/

Citation :

[...]

 

Results
https://preview.redd.it/i-built-a-small-hidden-tests-code-review-benchmark-and-ran-v0-2am91b6s0gqh1.png?width=1080&crop=smart&auto=webp&s=31f33916e81a442f53c5f1b7318022de8b9f02b2

 

Per-task scores (easy / medium / hard), then the weighted total:

  • Claude Sonnet 5: 93 / 96 / 95, weighted 95.0
  • Claude Opus 4.6: 88 / 96 / 92, weighted 92.7
  • Qwen 3.8 27B (Q6): 97 / 91 / 81, weighted 87.0


Hidden tests: Sonnet 162/162, Opus 162/162, Qwen 160/162. So the automated part alone is a three-way tie.
https://preview.redd.it/i-built-a-small-hidden-tests-code-review-benchmark-and-ran-v0-v599c8rt0gqh1.png?width=1080&crop=smart&auto=webp&s=9b84f386e9cc49814aeb933984f5cc2a844771be
https://preview.redd.it/i-built-a-small-hidden-tests-code-review-benchmark-and-ran-v0-czhyjnqv0gqh1.png?width=1080&crop=smart&auto=webp&s=f162adea682bf875d4cac93f883cc16921445b7d

 

What actually separated them
Sonnet 5 was the most consistent: never the best on a single task, never a bad one either. On the interpreter it was the only model that turned a Python RecursionError into a clean language-level error, and the only one that handled every OSError in the CLI. Its NOTES.md files were the most honest and matched the code in all three tasks.

 

Opus 4.6 wrote the most readable code (typed AST nodes, uniform error helpers) and by far the biggest self-written test suites (104 tests for the interpreter, 51 for the DAG runner). It lost points on robustness: the log analyzer's main() is a 130-line monolith that crashes on non-Latin characters when stdout is a Windows cp1252 console and on non-UTF-8 bytes in the input; the interpreter lets RecursionError and ValueError escape as raw Python exceptions.

 

Qwen 3.8 27B won the easy task (only model that survived every unicode/encoding probe) and then fell apart on the hard one. The interpreter has a general semantic bug: variable lookup does env.get(name) is not None, so any variable holding nil is reported as undeclared. Built-ins index args[0] without checking arity, so len() raises a raw IndexError instead of the language's runtime error. NOTES.md claims an arity check that doesn't exist. On the DAG runner it has a missing nonlocal: the "stop launching" flag is never actually set and fail-fast only works because of a second, redundant mechanism. The hidden tests didn't catch that; reading the code did.

 

Things all three got wrong the same way

  • Task 2: under timeout + retry, the next attempt starts while the timed-out thread is still alive, so real concurrency can exceed max_workers. The spec tolerates it (you can't kill a Python thread), but nobody flagged the consequence in their notes.
  • Task 3: Opus and Sonnet accept non-ASCII identifiers via str.isalpha(); the spec says [A-Za-z_].
  • Task 1: everyone treats a UTF-8 BOM as a malformed first line. Unspecified, so no penalty.


Caveats (please read before quoting the numbers)

  • n = 1. One run per model per task. Differences under ~3 points are noise.
  • The examiner and the grader are Claude (Fable 5.1, effort high). It wrote the tests and it graded sections B-E (45 of 100 points), which are judgments. I mitigated it by grading the three submissions of each task side by side against a written rubric and by citing line numbers for every deduction, but it's still one reviewer, and it's from the same family as two of the contestants. The full scorecards are in the repo if you want to disagree with a specific call.
  • The cp1252 crash that cost Opus and Sonnet points on task 1 is a Windows-console artifact. With PYTHONIOENCODING=utf-8 both pass. Removing that probe doesn't change the ranking.
  • Ceiling effect. 98-100% on hidden tests means these tasks are too easy for current frontier models on the functional axis. Round 2 will use deliberately incomplete specs, refactoring of existing buggy code, and tighter performance budgets.
  • Everything is Python stdlib-only, so this says nothing about other languages or about tool/agent workflows.
  • Qwen ran as a Q6 quant on local hardware. Some of the gap to the two API models may be quantization loss rather than the base model; I didn't test the unquantized weights.


What I'd take away

  • For the "does it work" question, all three are interchangeable on tasks of this size.
  • The gap shows up in what a senior reviewer looks at: does it die on weird input, is the code maintainable, do the notes tell the truth. That's where a 27B open model at Q6 is still visibly behind, and where Sonnet 5 edged out Opus 4.6 in this round.
  • Hidden tests are necessary but nowhere near sufficient. Qwen's nil-variable bug and the missing nonlocal are the kind of thing that ships and bites you in month two.


 

Après quelques jours à faire tourner 3.8 vs 3.6 avant : 3.6 a tendance à pisser plein de code, bien trop; 3.8 prend plus son temps, réfléchit plus longtemps, puis fait des changements plus chirurgicaux. En gros 3.6 = SWE débuttant qui veut pondre un max de code, et 3.8 semble plus être un SWE expérimenté.
Un truc qui me faisait tiquer avec 3.6 : je lui demande de progresser sur un plan : il travaille, puis me dit qu'on est entre 40% et 50% fait; je lui vide son historique (commande '/new' dans pi.dev) puis lui demande d'évaluer combien du plan est fait : 25% à 35%, et il critique certains aspects de ce qu'il venait juste de faire.


Message édité par tfpsly le 19-09-2026 à 20:52:16
 Page :   1  2  3  4  5  ..  65  66  67  68  69  70
Page Suivante

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)