Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
5547 connectés 

 


Ma famille de modèles préferée du quotidien ...
Ce sondage expirera le 01-11-2026 à 10:00




Attention si vous cliquez sur "voir les résultats" vous ne pourrez plus voter

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  74  75  76  77  78  79
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°51752
the_fennec
f3nn3cUs z3rd4
Posté le 30-09-2026 à 23:16:51  profilanswer
 

Reprise du message précédent :
Oui, dans le même genre il ya Strata aussi:
https://github.com/Niko1221/Strata
 

Code :
  1. Measured on an RTX 5070 (12 GB), a Ryzen 5 7600 and 64 GB of RAM:
  2. Size  Writes answers (short chat)  Writes answers (128K context)  Reads your prompt
  3. Q2_0  93 tokens/s  74 tokens/s  2,170 tokens/s
  4. IQ2_XS  79 tokens/s  63 tokens/s  2,090 tokens/s
  5. IQ3_XXS  62 tokens/s  49 tokens/s  1,750 tokens/s
  6. IQ3_S  53 tokens/s  46 tokens/s  1,620 tokens/s
  7. Coder (IQ1_M)  55 tokens/s  43 tokens/s  2,180 tokens/s


 
Le "coder" tient dans 32GB de RAM, 2k/s de PP :pt1cable: la ou je tiens péniblement le 100/s dans le meilleurs des cas.
 
Mais j'hésite a poster ce genre de trucs car les prérequis sont très stricts et c'est vraiment le genre de trucs qui peut diffuser des malware.
La procédure d'install est super crado et demande des sudo pour installer plein de trucs, dont CUDA...


---------------
Faudra que je teste un jour :o
n°51812
moyen_moin​s
chat réincarné
Posté le 01-10-2026 à 13:16:47  profilanswer
 

d'ailleurs, c'est quoi le truc le plus propre pour ce qwen 3.8 flash quand on a pas un strix halo ou un dgx spark ?
llama.cpp, un gpu avec 12/16GB de VRAM mini et 64GB de RAM + un SSD rapide ?

n°51824
Pipould's
Posté le 01-10-2026 à 15:02:11  profilanswer
 

16 + 96  
 
ou 32 + 64
 
Bien que des moteurs y arrivent avec 16 + 32
 

n°51841
the_fennec
f3nn3cUs z3rd4
Posté le 01-10-2026 à 17:18:33  profilanswer
 

moyen_moins a écrit :

d'ailleurs, c'est quoi le truc le plus propre pour ce qwen 3.8 flash quand on a pas un strix halo ou un dgx spark ?
llama.cpp, un gpu avec 12/16GB de VRAM mini et 64GB de RAM + un SSD rapide ?


 
C'est un modèle MoE donc il te faut au moins la VRAM+RAM pour avoir les attentions layers + experts et les ngrams sur SDD. Dans mon cas le SSD est un 2TB Sata.
 
Donc en fonction du quant que tu vises, tu peux faire ton calcul. J'ai remarqué que Unsloth (et pas mal d'autres) gardent les ngram dans un fichier séparé:
https://huggingface.co/unsloth/Qwen [...] UD-IQ3_XXS
Qwen3.8-Flash-Next-UD-IQ3_XXS-00002-of-00003.gguf     49.6 GB
Qwen3.8-Flash-Next-UD-IQ3_XXS-00003-of-00003.gguf     32.4 GB
 
Donc pour UD-IQ3_XXS il te faut 50GB de VRAM+RAM en plus de ton contexte.


---------------
Faudra que je teste un jour :o
n°51844
moyen_moin​s
chat réincarné
Posté le 01-10-2026 à 17:38:55  profilanswer
 

ok, j'essaierai ça dès que j'ai un peu de temps (depuis le temps que je le dis) :)
normalement, niveau conf, ça doit passer.
merci :jap:

n°51847
chris282
id steam/psn : chris282_fr
Posté le 01-10-2026 à 17:56:13  profilanswer
 

pourquoi 64 gb de ram ? pour offload ?

n°51884
the_fennec
f3nn3cUs z3rd4
Posté le 01-10-2026 à 23:00:58  profilanswer
 

Oui, enfin si t'as 64GB de VRAM t'en as pas besoin :o


---------------
Faudra que je teste un jour :o
n°51885
the_fennec
f3nn3cUs z3rd4
Posté le 01-10-2026 à 23:01:30  profilanswer
 

moyen_moins a écrit :

ok, j'essaierai ça dès que j'ai un peu de temps (depuis le temps que je le dis) :)


 
AKA Faudra que je teste un jour :o


---------------
Faudra que je teste un jour :o
n°51887
neo world
Posté le 01-10-2026 à 23:12:09  profilanswer
 

the_fennec a écrit :


 
AKA Faudra que je teste un jour :o


Copyright ©
 
Sinon nouveau sondage ! :D

n°51889
the_fennec
f3nn3cUs z3rd4
Posté le 01-10-2026 à 23:15:35  profilanswer
 

A voté :o


---------------
Faudra que je teste un jour :o
n°51891
the_fennec
f3nn3cUs z3rd4
Posté le 01-10-2026 à 23:30:55  profilanswer
 

Support MTP pour Qwen Next mergé :)
https://github.com/ggml-org/llama.cpp/pull/29761


---------------
Faudra que je teste un jour :o
n°51893
moyen_moin​s
chat réincarné
Posté le 02-10-2026 à 00:04:08  profilanswer
 

the_fennec a écrit :

 

AKA Faudra que je teste un jour :o


Demain  :D

 

edit: j'ai craqué, j'espère qu'amazon va pas me faire un coup de Trafalgar [:totoz]

Message cité 1 fois
Message édité par moyen_moins le 02-10-2026 à 01:03:27
n°51934
chris282
id steam/psn : chris282_fr
Posté le 02-10-2026 à 10:36:07  profilanswer
 
n°51938
the_fennec
f3nn3cUs z3rd4
Posté le 02-10-2026 à 11:02:55  profilanswer
 

moyen_moins a écrit :


Demain  :D  
 
edit: j'ai craqué, j'espère qu'amazon va pas me faire un coup de Trafalgar [:totoz]


 
c'est quoi c'est quoi?


---------------
Faudra que je teste un jour :o
n°51939
the_fennec
f3nn3cUs z3rd4
Posté le 02-10-2026 à 11:06:14  profilanswer
 

J'aime me faire du mal
 [:moudenc]  
 
Sur le Discord du cmp unlocker:
https://discord.gg/76YFM4una
 
A il ya des posts qui parlent d'unlock les 170hx 10GB en 80GB :pt1cable: au lieu des 40GB actuels, un autre parle de 76GB.


---------------
Faudra que je teste un jour :o
n°51941
neo world
Posté le 02-10-2026 à 11:08:13  profilanswer
 

the_fennec a écrit :

J'aime me faire du mal
 [:moudenc]  
 
Sur le Discord du cmp unlocker:
https://discord.gg/76YFM4una
 
A il ya des posts qui parlent d'unlock les 170hx 10GB en 80GB :pt1cable: au lieu des 40GB actuels, un autre parle de 76GB.


ne te fait pas du mal et donne le temps à la DDR6 d'arriver :D

n°51944
the_fennec
f3nn3cUs z3rd4
Posté le 02-10-2026 à 11:11:26  profilanswer
 

J'en ait déjà plein dans mes GPUs, enfin j'en veux bien plus :o


---------------
Faudra que je teste un jour :o
n°51946
neo world
Posté le 02-10-2026 à 11:14:48  profilanswer
 

the_fennec a écrit :

J'en ait déjà plein dans mes GPUs, enfin j'en veux bien plus :o


y'a pas un p'tit port USB 4 40Gb/s sur le bc250 pour les chainer plus efficacement ? Y'a des tests avec le strix halo dans ce sens. Sur le papier c'est malin et sans doute moins cher qu'une carte déjà débloquée mais qui ne marche pas donc remaquillée en carte "pour déblocage avec de la chance" sur ebay [:arantheus]

n°51950
moyen_moin​s
chat réincarné
Posté le 02-10-2026 à 11:25:16  profilanswer
 

the_fennec a écrit :

 

c'est quoi c'est quoi?


J'ai pris la r9700 pro ai qui était revenue en stock au même prix qu'il y a 1 semaine.
J'ai encore rien dit à Madame  :whistle:

 

Edit: du coup, soit je garde la 9060xt sur mon pc (64Go de VRAM) soit je la fous sur le bc-250 (32Go de VRAM mais seulement 28 exploitables) [:paysan]
Mon alim va être limite et j'ai pas de place dans le boîtier :o


Message édité par moyen_moins le 02-10-2026 à 11:27:45
n°51953
moyen_moin​s
chat réincarné
Posté le 02-10-2026 à 11:39:20  profilanswer
 

the_fennec a écrit :

J'aime me faire du mal
 [:moudenc]

 

Sur le Discord du cmp unlocker:
https://discord.gg/76YFM4una

 

A il ya des posts qui parlent d'unlock les 170hx 10GB en 80GB :pt1cable: au lieu des 40GB actuels, un autre parle de 76GB.


Faut tomber sur une carte vérifiée/validée mais du coup, v'là le tarif [:totoz]

n°51955
the_fennec
f3nn3cUs z3rd4
Posté le 02-10-2026 à 12:03:37  profilanswer
 

Ou revenir dans le temps il y a 6 mois et en acheter à 100 balles pièce :o


---------------
Faudra que je teste un jour :o
n°51956
moyen_moin​s
chat réincarné
Posté le 02-10-2026 à 12:05:26  profilanswer
 

the_fennec a écrit :

Ou revenir dans le temps il y a 6 mois et en acheter à 100 balles pièce :o


dans ce cas là, achète des btc plutôt :o

n°51957
neo world
Posté le 02-10-2026 à 12:21:14  profilanswer
 

the_fennec a écrit :

Ou revenir dans le temps il y a 6 mois et en acheter à 100 balles pièce :o


prends m'en une dizaine alors :o

n°51959
the_fennec
f3nn3cUs z3rd4
Posté le 02-10-2026 à 12:36:07  profilanswer
 

moyen_moins a écrit :

dans ce cas là, achète des btc plutôt :o


Trop facile :o
 

neo world a écrit :

prends m'en une dizaine alors :o


 
OK, je te tiens au courant dès que Qwen a fini ma machine a voyager dans le temps :D.


---------------
Faudra que je teste un jour :o
n°51965
lapin
Posté le 02-10-2026 à 13:53:27  profilanswer
 

C'est très moyens, mais on s'en contentera:
 
Il doit copié la forme géométrique qui suite:
 
https://www.dropbox.com/scl/fi/6ppse0zjbzvj2n013rfug/Xct3mgs.png?rlkey=dbrpr077ahzqg1goqkzko8pyf&st=d6lmqcnw&dl=1
 
 
Après près d'une heure et 4 promptes au total, il aurait réussit à faire ceci:
 
https://www.dropbox.com/scl/fi/el937zrsviqe2lm7u3ynd/Capture-d-cran-2026-10-02-131757.png?rlkey=szg7eedduphfye07ph5b2riyb&st=s8uzrw2t&dl=1
(au format PNG)
 
 
En fichier SVG: https://www.dropbox.com/scl/fi/890b [...] pd2hd&dl=1
 
le script SVG:

Code :
  1. <svg width="500" height="595" viewBox="0 0 500 595" xmlns="http://www.w3.org/2000/svg" style="background-color: white;">
  2.   <!-- Lignes de structure -->
  3.   <g stroke="black" stroke-width="2" fill="none">
  4.     <!-- Tracé A -> E -> B -->
  5.     <line x1="50" y1="50" x2="450" y2="200" />
  6.     <!-- Tracé D -> H -> C (parallèle à AB) -->
  7.     <line x1="50" y1="300" x2="450" y2="450" />
  8.     <!-- Tracé G -> F (parallèle à AB) -->
  9.     <line x1="50" y1="435" x2="200" y2="491" />
  10.     <!-- Segment A -> D -->
  11.     <line x1="50" y1="50" x2="50" y2="300" />
  12.     <!-- Segment D -> G (Légèrement raccourci) -->
  13.     <line x1="50" y1="300" x2="50" y2="435" />
  14.     <!-- Segment E -> F (vertical, légèrement raccourci entre H et F) -->
  15.     <line x1="200" y1="106" x2="200" y2="491" />
  16.     <!-- Segment B -> C -->
  17.     <line x1="450" y1="200" x2="450" y2="450" />
  18.   </g>
  19.   <!-- Étiquettes de texte -->
  20.   <g font-family="Arial, sans-serif" font-size="16" fill="black">
  21.     <text x="40" y="45" text-anchor="end">A</text>
  22.     <text x="460" y="205" text-anchor="start">B</text>
  23.     <text x="460" y="465" text-anchor="start">C</text>
  24.     <text x="40" y="305" text-anchor="end">D</text>
  25.     <text x="210" y="106">E</text>
  26.     <text x="210" y="510">F</text>
  27.     <text x="40" y="440" text-anchor="end">G</text>
  28.     <text x="210" y="356">H</text>
  29.   </g>
  30. </svg>


 
 
Bilant:
 
C'est nul c'est 100 fois trop long, 3 prompts en plus pour corriger ses conneries.
Chaque nouvelle itération avec un même prompte de dépars génère autant de résultats différents et débile à souhait, en fait ça n'est pas une IA, c'est un générateur de Nombre qui tente d'essaier sans y arrive de trouvé le bons résultats, nombre qui sont ensuite traduit en Tokens Alphanumérique.
L'IA est débile, et résultat aléatoire sur le même prompt.
Depuis le navigateur et l'ordinateur, il ne faut rien faire d'autre que la génération de raisonnement IA, car sinon ça gêne la qualité de raisonnement et de logique.
 
Il faut forcément un Carte Graphique récente donc pas une carte avec un RX-VEGA56, et il faut au moins 36 GO de VRAM voir plus.
C'est plantogène en version Beta.


Message édité par lapin le 02-10-2026 à 13:53:48
n°51973
Gugus2000
Profil : Rien
Posté le 02-10-2026 à 16:37:11  profilanswer
 

Hello,
 
Je voudrais savoir comment adresser au mieux mon cas d'usage.
J'ai recuper une archive outlook au format PST. (4Go)
Je voudrais faire tourner un llm dessus pour rechercher des mails particulier (exemple : nb de mails recu par jour, le samedi le dimanche). En tous cas poser des questions que ca analuse la data et que ca puisse me sortir des choses.
 
 
je suppose que ca passe forcement par une IA en local ? Je veux pas non plus un simple chatbot il y a des questions qui demanderont une analyse un peu fine du mail.
 
C'est pour un usage oneshot ca me derange pas de payer qq dizaines d'euros pour avoir un resultat si ca me simplifie la vie
 
Ca vous semble quoi le meilleur schema sans trop me prendre la tete ?
 
 


---------------
Je décline toute responsabilité potentielle pour le contenu de mes propos et contenu multimedia (images, videos et sons) + miroir magic.
n°51974
moyen_moin​s
chat réincarné
Posté le 02-10-2026 à 16:48:30  profilanswer
 

t'as un besoin de confidentialité pour faire ça en local ou bien tu t'en fous et tu go "model fontier" ?
edit: par exemple avec Claude, tu as : https://www.getclaudeskills.com/ski [...] t-mukul975
ou si tu veux mettre les mains dans le cambouis : https://github.com/nweii/convert-psts


Message édité par moyen_moins le 02-10-2026 à 16:53:28
n°51977
speedboyz3​0
Guide Michelin :o
Posté le 02-10-2026 à 17:42:01  profilanswer
 

Nvidia annonce le DGX Spark 64Gb à 5000 balles et le 128Gb passe à 7000 balles.  
 
FOMO  :mad:

n°51978
alanou
Remembering M.P.
Posté le 02-10-2026 à 18:35:02  profilanswer
 

Gugus2000 a écrit :

Hello,
 
Je voudrais savoir comment adresser au mieux mon cas d'usage.
J'ai recuper une archive outlook au format PST. (4Go)
Je voudrais faire tourner un llm dessus pour rechercher des mails particulier (exemple : nb de mails recu par jour, le samedi le dimanche). En tous cas poser des questions que ca analuse la data et que ca puisse me sortir des choses.
 
 
je suppose que ca passe forcement par une IA en local ? Je veux pas non plus un simple chatbot il y a des questions qui demanderont une analyse un peu fine du mail.
 
C'est pour un usage oneshot ca me derange pas de payer qq dizaines d'euros pour avoir un resultat si ca me simplifie la vie
 
Ca vous semble quoi le meilleur schema sans trop me prendre la tete ?
 
 


 
C’est pas le job d’un LLM, c’est du tool calling. En soi le LLM va jamais avoir besoin de lire le contenu de tes mails


---------------
Bolidage tête rouge - ateliers certifiés ISO0069
n°51979
neo world
Posté le 02-10-2026 à 18:38:11  profilanswer
 

speedboyz30 a écrit :

Nvidia annonce le DGX Spark 64Gb à 5000 balles et le 128Gb passe à 7000 balles.  
 
FOMO  :mad:


Ce doit être pour montrer que la nouvelle station pour développeur d’AMD ne les impressionne pas ^^
 
Encore quelques mois et ils vont te ressortir le 5090 avec moins de mémoire pour le même prix qu’aujourd’hui tant ils sont pas impressionnés par les gammes AMD :whistle:

n°51982
the_fennec
f3nn3cUs z3rd4
Posté le 02-10-2026 à 18:57:30  profilanswer
 

speedboyz30 a écrit :

Nvidia annonce le DGX Spark 64Gb à 5000 balles et le 128Gb passe à 7000 balles.  
 
FOMO MOFO  :mad:


 
FTFY :o


---------------
Faudra que je teste un jour :o
n°51983
speedboyz3​0
Guide Michelin :o
Posté le 02-10-2026 à 18:59:08  profilanswer
 

neo world a écrit :


Ce doit être pour montrer que la nouvelle station pour développeur d’AMD ne les impressionne pas ^^
 
Encore quelques mois et ils vont te ressortir le 5090 avec moins de mémoire pour le même prix qu’aujourd’hui tant ils sont pas impressionnés par les gammes AMD :whistle:


 
Effectivement  :cry:  
 
Je peux chopper un Asus GX10 à 4000 euros. C’est tentant ! Bon placement :o
Mais le Mac Studio est meilleur sur 90% des cas :o

n°51986
the_fennec
f3nn3cUs z3rd4
Posté le 02-10-2026 à 19:37:22  profilanswer
 

I made my iPhone a second GPU for my 24 GB MacBook: Qwen 3.8 27B prefills 29–44% faster & my holds part of the CTX window
https://www.reddit.com/r/LocalLLaMA [...] r_my_24_gb
 
:love: c'est du vibecode mais j'approuve quand même, on va dire que le scotch est dans le soft :o


---------------
Faudra que je teste un jour :o
n°51992
alanou
Remembering M.P.
Posté le 02-10-2026 à 20:34:06  profilanswer
 

neo world a écrit :


Ce doit être pour montrer que la nouvelle station pour développeur d’AMD ne les impressionne pas ^^
 
Encore quelques mois et ils vont te ressortir le 5090 avec moins de mémoire pour le même prix qu’aujourd’hui tant ils sont pas impressionnés par les gammes AMD :whistle:


 
 
Déjà ils ont été sympa de conserver la BP mémoire et pas de juste enlever la moitié des puces  :o  
 
J'hésite à revendre mon laptop en Strix Halo et à passer sur un Macbook Pro (M5 Pro, sans extravagance), vu les prix actuels je pourrais m'en sortir pour presque rien en plus  :o


---------------
Bolidage tête rouge - ateliers certifiés ISO0069
n°51998
moyen_moin​s
chat réincarné
Posté le 02-10-2026 à 23:25:19  profilanswer
 

Personne a testé Strata ?

n°52003
gremi
Vieux con des neiges d'antan
Posté le 03-10-2026 à 07:58:10  profilanswer
 

moyen_moins a écrit :

Personne a testé Strata ?


Testé hier, ultra impressionnant ...
Je tourne à 70 t/s, sur Qwen flash next en iq3, 70t/s  [:gremi:1]  (5070 ti / 64 Go DDR5)
Pas eu le temps de tester en profondeur, mais ça semble vraiment être  [:apges:5]
(je vais le faire tourner avec Opencode aujourd'hui)

Message cité 1 fois
Message édité par gremi le 03-10-2026 à 07:58:53

---------------
In aligot we trust.
n°52033
the_fennec
f3nn3cUs z3rd4
Posté le 03-10-2026 à 11:50:34  profilanswer
 

Bon, sans surprise le tensor mode en RPC est super lent avec un réseau GB classique :(
Avec Qwen 27B j'ai 8/s en PP au lieu de 100, mais juste 2.5/s au lieu de 5/s en génération.
 
Au moins, ça m'a permis de tester le build de branches en local.


---------------
Faudra que je teste un jour :o
n°52035
the_fennec
f3nn3cUs z3rd4
Posté le 03-10-2026 à 11:53:57  profilanswer
 

moyen_moins a écrit :

Personne a testé Strata ?


 
J'ai l'impression qu'il bénéficie juste de features qui sont en cours de dev dans llama.cpp, a savoir le MTP et le LRU cache pour les experts en MoE. Le premier vient d'être mergé, mais le second est en dev et ya pas mal de discussions encore...
 
J'ai un peu la flemme de saloper ma nouvelle VM avec CUDA et Python :o


---------------
Faudra que je teste un jour :o
n°52040
moyen_moin​s
chat réincarné
Posté le 03-10-2026 à 12:12:28  profilanswer
 

gremi a écrit :


Testé hier, ultra impressionnant ...
Je tourne à 70 t/s, sur Qwen flash next en iq3, 70t/s  [:gremi:1]  (5070 ti / 64 Go DDR5)
Pas eu le temps de tester en profondeur, mais ça semble vraiment être  [:apges:5]
(je vais le faire tourner avec Opencode aujourd'hui)


J'ai vu que c'était compatible avec AMD et pas que NVIDIA.
Faut que je teste avec Qwen flash.

n°52046
moyen_moin​s
chat réincarné
Posté le 03-10-2026 à 12:44:47  profilanswer
 

the_fennec a écrit :


 
J'ai l'impression qu'il bénéficie juste de features qui sont en cours de dev dans llama.cpp, a savoir le MTP et le LRU cache pour les experts en MoE. Le premier vient d'être mergé, mais le second est en dev et ya pas mal de discussions encore...
 
J'ai un peu la flemme de saloper ma nouvelle VM avec CUDA et Python :o


c'est ce que j'ai vu en vidéo aussi hier soir :jap:
mais bon, tant qu'on peut en profiter en avance :o

n°52048
the_fennec
f3nn3cUs z3rd4
Posté le 03-10-2026 à 12:47:18  profilanswer
 

moyen_moins a écrit :


c'est ce que j'ai vu en vidéo aussi hier soir :jap:
mais bon, tant qu'on peut en profiter en avance :o


 
Tout fait :jap: après j'ai un peu la flemme car ya c'est du python et c'est toujours le merdier et qu'on plus ya pas de clustering, donc je suis juste avec un GPU.


---------------
Faudra que je teste un jour :o
 Page :   1  2  3  4  5  ..  74  75  76  77  78  79

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)