Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
3057 connectés 

 


Je génère ...
Sondage à 3 choix possibles.
Ce sondage expirera le 20-09-2026 à 10:00




Attention si vous cliquez sur "voir les résultats" vous ne pourrez plus voter

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  49  50  51  ..  56  57  58  59  60  61
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°46647
Pipould's
Posté le 28-08-2026 à 16:30:39  profilanswer
 

Reprise du message précédent :

moyen_moins a écrit :

Bc-250 reçu, va falloir que j'installe tout ça ce weekend et que je regarde quel modèle je peux mettre la dessus :o
Trop de trucs à tester et le Z qui revient, j'espère qu'il fera moche ce weekend :o


Reçu moi aussi , mais en France chez mes parents, du coup ça va prendre plus de temps ^^

n°46648
the_fennec
f3nn3cUs z3rd4
Posté le 28-08-2026 à 16:35:29  profilanswer
 

moyen_moins a écrit :


La dernière de LM Studio :o
J'ai testé en speed ce matin avant d'aller bosser.
Je vais essayer en changeant le template jinja en rentrant.


 
Au moins tu vas pas mettre LM Studio sur ta BC250 :o


Message édité par the_fennec le 28-08-2026 à 16:45:59

---------------
Faudra que je teste un jour :o
n°46649
neo world
Posté le 28-08-2026 à 16:37:52  profilanswer
 

Ça va computer je vois :D

n°46650
the_fennec
f3nn3cUs z3rd4
Posté le 28-08-2026 à 16:49:03  profilanswer
 

Je suis en train de test Ornith-1.5-35B-A3B-Q6_K_L.
PP a 200, tgs a 15, ça change de 27B :o
 
Pour le moment il se débrouille pas mal.


---------------
Faudra que je teste un jour :o
n°46651
moyen_moin​s
chat réincarné
Posté le 28-08-2026 à 17:05:30  profilanswer
 

Bon, les derniers UD3 d'unsloth refusent de fonctionner chez moi, même avec un nouveau template jinja. J'ai testé plein d'options etc. ça veut rien savoir.
1ère fois que je vois ça, ça me soule, ça dégage tant pis :o

n°46652
neo world
Posté le 28-08-2026 à 17:12:16  profilanswer
 

the_fennec a écrit :

Je suis en train de test Ornith-1.5-35B-A3B-Q6_K_L.
PP a 200, tgs a 15, ça change de 27B :o
 
Pour le moment il se débrouille pas mal.


Il est mieux que Qwen 3,6 35b ?

n°46669
neo world
Posté le 28-08-2026 à 22:25:04  profilanswer
 

Pour ceux qui voudraient tenter l'aventure de colibri mais se demandent si leurs nvme (au nombre de 2) risquent de surchauffer :

Code :
  1. watch -n 1 "echo '=== NVME0 ===' && sudo nvme smart-log /dev/nvme0 | grep -E 'temperature|Sensor' && echo '' && echo '=== NVME1 ===' && sudo nvme smart-log /dev/nvme1 | grep -E 'temperature|Sensor'"


 
Ca vous montre les valeurs des sondes de vos deux premiers nvme (à ajuster selon votre cas)  

Code :
  1. === NVME0 ===
  2. temperature                             : 41 °C (314 K, 105 °F)
  3. Temperature Sensor 1                    : 55 °C (328 K, 131 °F)
  4. Temperature Sensor 2                    : 96 °C (369 K, 204 °F)
  5. Temperature Sensor 3                    : 41 °C (314 K, 105 °F)
  6. === NVME1 ===
  7. temperature                             : 40 °C (313 K, 104 °F)
  8. Temperature Sensor 1                    : 47 °C (320 K, 116 °F)
  9. Temperature Sensor 2                    : 90 °C (363 K, 194 °F)
  10. Temperature Sensor 3                    : 40 °C (313 K, 104 °F)


Le sensor 2 donne la température maximale observée du nvme dans sa vie (dans mon cas le controleur de m**** de ces kingstons)  
 
Pour générer de la workload en lecture qui tâche  

Code :
  1. sudo fio --name=read_nvme0 --filename=/dev/nvme0n1 --rw=read --direct=1 --ioengine=libaio --bs=1M --numjobs=1 --iodepth=32 --runtime=120 --time_based --status-interval=5


Tout est dans les valeurs mais en gros pendant 120 secondes ça va tabasser en lecture (donc pas de risque d'usure prématurée) nvme0n1 (à ajuster par rapport à votre config toujours). Faut installer fio depuis vos repos préférés :)
 
Avec un second terminal en simultané sur les températures vous aurez uen bonne idée de ce qu'ils se passe :jap:

n°46670
neo world
Posté le 28-08-2026 à 22:36:54  profilanswer
 
n°46671
tfpsly
Sly
Posté le 28-08-2026 à 23:29:54  profilanswer
 

Posage de drapal.
Et mes expérimentations jusque là. Amateur d'agents LMM au bureau depuis presque un an (je consomme entre 40M et 80M de tokens par jours, merci la boite - ça permet vraiment de devenir manager d'agents), je tente depuis plusieurs mois de reproduire cet environment à la maison sur une RTX 3060 12gb.
Plusieurs essais sur Qwen 2.5 Coder, 3.5, Gemma E4B, Ministral etc., dans VsCode/Cline, Continue...

  • Qwen 2.5 qwen2.5-coder-14b-instruct-q4_k_m : rapide, bien pour des tâches simples; mais devient rapidement buté, refusant de changer de stratégie. Ex : je lui interdis d'utiliser une lib ou une approche foireuse, il va tourner pendant plusieurs minutes puis revenir en douce sur l'approche foireuse sans me prévenir.
  • Qwen 3.5 Qwen3.5-9B-Q5_K_M : légèrement moins rapide mais ça va; pas mal la plupart du temps; mais dans certains crashs, il va partir dans tous les sens, essayer n'importe quoi et
  • Gemma E4B gemma-4-E4B-it-Q4_K_M : très très rapide; mais gros problème dans Cline qui n'arrive pas à parser ses réponses. Continue fonctionne mieux... mais coupe les fichiers après quelques centaines de lignes. Donc poubelle les deux.


Donc mare des extensions sous VsCode. Je découvre qu'il y a des coding agents en ligne de commande . Aider (orienté Git, pas ce que j'utilise), OpenCode, Pi.dev... OpenCode semble intéressant, Pi.dev aussi mais semble demander plus de configs+extensions...

  • Mais toujours les mêmes problèmes avec les modèles Qwen devenant butés dès qu'il y a un pb; et gemma... qui met Opencode en pause attendant un input quasiment après chaque outil lancé. Casse-couil...
  • Et finalement, un LLM en ligne qui me propose une solution pour Gemma : faut juste... lui dire de ne pas faire de pause après chaque outil lancé :ouch:  :sarcastic:  Mais c'est quoi cette m.... ?!?! [:330tdx2] Enfin, en tout cas ça semble bien aider :
Citation :

 "provider": {
    "local-llama": {
      "npm": "@ai-sdk/openai-compatible",
      "name": "Llama.cpp",
      "options": {
        "baseURL": "http://127.0.0.1:8080/v1",
  "systemPrompt": "Available tools: glob(pattern); read(filePath); bash(command). Always reply with valid tool call format blocks. Do not insert empty stop turns after tool execution.",
        "apiKey": "local"
      },
      "models": {
[...]

 

Bref, je continue à expérimenter entre Qwen 3.5, et Gemma quand Q3.5 devient trop con.

 

EDIT - Qwen 3.6 à 22tk/s sur ma 3060 12gb :love:

Code :
  1. llama-server -m ~/models/Qwen3.6-35B-A3B-APEX-I-Compact.gguf -ngl 99 -a Qwen3.6-35B-A3B-APEX-64k --host 0.0.0.0 --port 8080 \
  2.     --fit off -fa on -ot ".*ffn_.*_exps=CPU" --ctx-size 32768  --threads 6 --threads-batch 6 \
  3.     --cpu-range 0-5 --cpu-strict 1 --cpu-range-batch 0-5 --cpu-strict-batch 1 --numa isolate --prio 2 --mmap --parallel 1 --jinja \
  4.     --cache-type-k q4_0 --cache-type-v q4_0 \
  5.     --ubatch-size 256 --batch-size 512 --cache-reuse 256 --ctx-checkpoints 8 --metrics

Message cité 2 fois
Message édité par tfpsly le 30-08-2026 à 23:57:27
n°46672
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 28-08-2026 à 23:32:14  profilanswer
 


 
 
[:turbocat:1][:turbocat:1][:turbocat:1]


---------------
Victime de girafophobie, mais se soigne.
n°46674
moyen_moin​s
chat réincarné
Posté le 29-08-2026 à 01:18:47  profilanswer
 

j'viens de voir la vidéo d'un polonais qui a mis une 9070 à la place du nvme sur son bc-250 :o
et le nvme en usb3 via adaptateur :o

n°46675
AllenMadis​on
Oracle du Keb's
Posté le 29-08-2026 à 01:53:34  profilanswer
 

moyen_moins a écrit :

j'viens de voir la vidéo d'un polonais qui a mis une 9070 à la place du nvme sur son bc-250 :o
et le nvme en usb3 via adaptateur :o


 
Y'a bien qu'un polonais pour faire ça après quelques bouteilles de vodka :o


---------------
Nothing much to teach, man. There's ze high, there's ze low and yall still fucking miss.
n°46676
moyen_moin​s
chat réincarné
Posté le 29-08-2026 à 02:27:06  profilanswer
 

pour moins de 20 balles, je vais essayer :o
j'ai une RX6700 qui traine, 26GB de VRAM au total, il y a moyen de faire tourner un truc sympa en Q3-Q4 :o

n°46678
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 29-08-2026 à 07:02:45  profilanswer
 

Lien de la vidéo, please  :O


---------------
Victime de girafophobie, mais se soigne.
n°46686
the_fennec
f3nn3cUs z3rd4
Posté le 29-08-2026 à 08:57:47  profilanswer
 

moyen_moins a écrit :

Bon, les derniers UD3 d'unsloth refusent de fonctionner chez moi, même avec un nouveau template jinja. J'ai testé plein d'options etc. ça veut rien savoir.
1ère fois que je vois ça, ça me soule, ça dégage tant pis :o


 
1 Définis "refusent de fonctionner" :o
2 Essaye llama.cpp
 

neo world a écrit :


Il est mieux que Qwen 3,6 35b ?


Il est meilleur dans les bench :o Certain Youtubers disent qu'il est meilleur :o
J'avais posté une vidéo de Luke Dev's Lab, il avait l'air content.
 
De mon coté, ça a l'air d'aller, pas de différence flagrante avec 35B.
 


 [:-cas-:3]  
Alors, combien de secondes par token? :D


---------------
Faudra que je teste un jour :o
n°46688
the_fennec
f3nn3cUs z3rd4
Posté le 29-08-2026 à 09:00:24  profilanswer
 

moyen_moins a écrit :

pour moins de 20 balles, je vais essayer :o
j'ai une RX6700 qui traine, 26GB de VRAM au total, il y a moyen de faire tourner un truc sympa en Q3-Q4 :o


 
 :jap: je voulais faire pareil, mais j'ai pas de CG qui vaut le coup, alors j'ai pris une deuxième BC250 :o


---------------
Faudra que je teste un jour :o
n°46691
neo world
Posté le 29-08-2026 à 10:25:04  profilanswer
 

the_fennec a écrit :


 [:-cas-:3]  
Alors, combien de secondes par token? :D


10 secondes par token 0,1tps  [:dipterolyse]  
 
Bon mais sur CPU sur quelque chose comme 6 coeurs. Je commençais à regarder comment intégrer le GPU dans python venv mais je me suis fait rattraper par la patrouille (enfants en bas âge) et j'ai du laisser en plan mon test. Je verrai ce soir si j'ai plus de temps pour creuser la question serieusement :jap: mais bon ça tourne  [:wark0]

n°46692
moyen_moin​s
chat réincarné
Posté le 29-08-2026 à 10:36:32  profilanswer
 

Tronklou a écrit :

Lien de la vidéo, please  :O


https://youtu.be/O1SxtBcbXx4
c'est pour du gaming mais qui peut le plus peut le moins :o

n°46693
moyen_moin​s
chat réincarné
Posté le 29-08-2026 à 10:37:57  profilanswer
 

the_fennec a écrit :


 
1 Définis "refusent de fonctionner" :o
2 Essaye llama.cpp
 


toujours le même message d'erreur, il a rien à dire au 1er prompt et décharge le modèle direct
 

the_fennec a écrit :


 
 :jap: je voulais faire pareil, mais j'ai pas de CG qui vaut le coup, alors j'ai pris une deuxième BC250 :o


par le réseau, j'ai lu qu'il fallait pas dépasser 2 BC-250 sinon ça servait à rien.
mais vu que j'ai cette RX6700 qui traine, je vais essayer

Message cité 1 fois
Message édité par moyen_moins le 29-08-2026 à 10:38:55
n°46698
the_fennec
f3nn3cUs z3rd4
Posté le 29-08-2026 à 11:33:22  profilanswer
 

neo world a écrit :


10 secondes par token 0,1tps  [:dipterolyse]  
 
Bon mais sur CPU sur quelque chose comme 6 coeurs. Je commençais à regarder comment intégrer le GPU dans python venv mais je me suis fait rattraper par la patrouille (enfants en bas âge) et j'ai du laisser en plan mon test. Je verrai ce soir si j'ai plus de temps pour creuser la question serieusement :jap: mais bon ça tourne  [:wark0]


Mets Qwen27B dessus: "fais moi tourner le bordel a 10 tps :o"
 
 

moyen_moins a écrit :


toujours le même message d'erreur, il a rien à dire au 1er prompt et décharge le modèle direct


Essaye l'étape 2 :o
 

moyen_moins a écrit :


par le réseau, j'ai lu qu'il fallait pas dépasser 2 BC-250 sinon ça servait à rien.
mais vu que j'ai cette RX6700 qui traine, je vais essayer


 
T'as lu dla merde :o
Je suis a 3 nœuds RPC en comptant ma VM Windows, et les MoE tournent très bien. La sur Ornith (ou 35B) je fais du 200 en pp (moins en fin de contexte) et 12/20 tgs.
Je dis pas que c'est une config que je recommanderais, mais je peux charger Qwen Next et il tourne a 10 tgs ... enfin il crash au 365 ième token généré :o
https://github.com/ggml-org/llama.cpp/issues/27939


---------------
Faudra que je teste un jour :o
n°46701
neo world
Posté le 29-08-2026 à 11:38:27  profilanswer
 

tfpsly a écrit :

Posage de drapal.
je consomme entre 40M et 80M de tokens par jours
Bref, je continue à expérimenter entre Qwen 3.5, et Gemma quand Q3.5 devient trop con.


Bienvenue cher producteur / crameur de jetons  [:zoreil974]


Message édité par neo world le 29-08-2026 à 12:03:49
n°46704
neo world
Posté le 29-08-2026 à 11:40:22  profilanswer
 

the_fennec a écrit :


Mets Qwen27B dessus: "fais moi tourner le bordel a 10 tps :o"
 
 


 
A 10 TPS j'abandonne Qwen :o

n°46709
moyen_moin​s
chat réincarné
Posté le 29-08-2026 à 12:02:20  profilanswer
 

the_fennec a écrit :

 

T'as lu dla merde :o
Je suis a 3 nœuds RPC en comptant ma VM Windows, et les MoE tournent très bien. La sur Ornith (ou 35B) je fais du 200 en pp (moins en fin de contexte) et 12/20 tgs.
Je dis pas que c'est une config que je recommanderais, mais je peux charger Qwen Next et il tourne a 10 tgs ... enfin il crash au 365 ième token généré :o
https://github.com/ggml-org/llama.cpp/issues/27939


j'avais lu ça 2-3 fois mais si tu dis que ça marche bien, ça remet les choses en perspective [:transparency]

 

par contre, je teste qwen 3.8 27B en Q4+ d'atomic chat vs leur version Q6 sur un prompt et franchement... le Q6 c'était parfait du 1er coup. le Q4+ non et de loin !
en plus, en Q4 hier soir, il m'a bouffé 66k de contexte pour raisonner et pondre la moitié de ce que je lui demandais ensuite.
j'ai l'impression que Q4 ça fait des trucs qui marchent mais c'est assez basique comme résultat. [:paysan]

 

edit: par contre si je lui rappelle sans arrêt de pas "sur-penser" ( :o ), ça réduit fortement la conso/.le gaspillage de contexte.

Message cité 1 fois
Message édité par moyen_moins le 29-08-2026 à 12:13:08
n°46714
speedboyz3​0
Guide Michelin :o
Posté le 29-08-2026 à 12:54:41  profilanswer
 

neo world a écrit :


si je devais choisir pour toi :
=> Asus pro art Strix halo si tu veux du microsoft / linux (le bordel Nvidia sera probablement très bien mais sans X86 ta machine sera franchement diminuée pour du workstation même si l'emulation sauvera un peu les meubles (coeurs ARM qui commencent à être franchement anciens côté Nvidia)
=> Macbook pro 16" si tu veux du portable avec une autonomie ridiculement longue et de la puissance à revendre
=> Mac Studio si tu veux une machine à tout faire économe en energie et rapide
=> BosgamePC si 128GB de ram est un must pour toi mais au delà de 2500 balles c'est compliqué à justifier
 
Sur strix halo il commence à y avoir des optimisations et des tuto pour Qwen 3.8 flash :
https://www.soothill.io/blog/2026/0 [...] trix-halo/
 
Je m'attends à ce que ça bouge bien sur les prochains jours. J'attends mes ventilo pour les NVME avant de me lancer à mon tour :jap:


 
Pas convaincu par le Asus. Ultra Portable avec du throttling ?
Niveau tarif le macbook pro ça chiffre beaucoup plus vite quand même.
Le bosgame est à 2600 euros en ce moment je crois :jap:  
 
J'ai vu un truc pas trop cher sur une offre de rentrée MSI Vector 17 HX AI.
 
3000 balles pour :
Free Dos
Intel Core Ultra 9 275HX
GeForce RTX 5090
17", 2560x1600 QHD+
32 GB RAM, 1 TB SSD
 
Le Mac Studio c'est sympa aussi niveau revente dans 2 ans, ça change pas mal l'équation.

n°46715
the_fennec
f3nn3cUs z3rd4
Posté le 29-08-2026 à 13:06:04  profilanswer
 

tfpsly a écrit :

Posage de drapal.
Et mes expérimentations jusque là. Amateur d'agents LMM au bureau depuis presque un an (je consomme entre 40M et 80M de tokens par jours, merci la boite - ça permet vraiment de devenir manager d'agents), je tente depuis plusieurs mois de reproduire cet environment à la maison sur une RTX 3060 12gb.
Plusieurs essais sur Qwen 2.5 Coder, 3.5, Gemma E4B, Ministral etc., dans VsCode/Cline, Continue...

  • Qwen 2.5 qwen2.5-coder-14b-instruct-q4_k_m : rapide, bien pour des tâches simples; mais devient rapidement buté, refusant de changer de stratégie. Ex : je lui interdis d'utiliser une lib ou une approche foireuse, il va tourner pendant plusieurs minutes puis revenir en douce sur l'approche foireuse sans me prévenir.
  • Qwen 3.5 Qwen3.5-9B-Q5_K_M : légèrement moins rapide mais ça va; pas mal la plupart du temps; mais dans certains crashs, il va partir dans tous les sens, essayer n'importe quoi et  
  • Gemma E4B gemma-4-E4B-it-Q4_K_M : très très rapide; mais gros problème dans Cline qui n'arrive pas à parser ses réponses. Continue fonctionne mieux... mais coupe les fichiers après quelques centaines de lignes. Donc poubelle les deux.


Donc mare des extensions sous VsCode. Je découvre qu'il y a des coding agents en ligne de commande . Aider (orienté Git, pas ce que j'utilise), OpenCode, Pi.dev... OpenCode semble intéressant, Pi.dev aussi mais semble demander plus de configs+extensions...

  • Mais toujours les mêmes problèmes avec les modèles Qwen devenant butés dès qu'il y a un pb; et gemma... qui met Opencode en pause attendant un input quasiment après chaque outil lancé. Casse-couil...
  • Et finalement, un LLM en ligne qui me propose une solution pour Gemma : faut juste... lui dire de ne pas faire de pause après chaque outil lancé :ouch:  :sarcastic:  Mais c'est quoi cette m.... ?!?! [:330tdx2] Enfin, en tout cas ça semble bien aider :
Citation :

 "provider": {
    "local-llama": {
      "npm": "@ai-sdk/openai-compatible",
      "name": "Llama.cpp",
      "options": {
        "baseURL": "http://127.0.0.1:8080/v1",
  "systemPrompt": "Available tools: glob(pattern); read(filePath); bash(command). Always reply with valid tool call format blocks. Do not insert empty stop turns after tool execution.",
        "apiKey": "local"
      },
      "models": {
[...]


 
Bref, je continue à expérimenter entre Qwen 3.5, et Gemma quand Q3.5 devient trop con.


 
 
Bienvenue  :jap:  
 
C'est quoi ta config coté hard?
 
Laisses tomber les vieux modèles, genre qwen2.5 ou Ministral tu perds ton temps.
 
Je te conseillerais d'essayer Qwen 3.6 35B avec des experts mis sur le CPU si tu as de la RAM en abondance ET le template de froggeric:
https://huggingface.co/froggeric/Qw [...] -Templates
 
Q4_K_M
https://huggingface.co/unsloth/Qwen3.6-35B-A3B-GGUF
 
Attention si tu est sous Windows, regarde si tu as des applis qui te bouffent de la VRAM!
 
Tu peux regarder cette vidéo pour avoir de l’inspiration:
https://www.youtube.com/watch?v=8F_5pdcD3HY


---------------
Faudra que je teste un jour :o
n°46716
the_fennec
f3nn3cUs z3rd4
Posté le 29-08-2026 à 13:12:20  profilanswer
 

moyen_moins a écrit :


j'avais lu ça 2-3 fois mais si tu dis que ça marche bien, ça remet les choses en perspective [:transparency]  
 
par contre, je teste qwen 3.8 27B en Q4+ d'atomic chat vs leur version Q6 sur un prompt et franchement... le Q6 c'était parfait du 1er coup. le Q4+ non et de loin !
en plus, en Q4 hier soir, il m'a bouffé 66k de contexte pour raisonner et pondre la moitié de ce que je lui demandais ensuite.
j'ai l'impression que Q4 ça fait des trucs qui marchent mais c'est assez basique comme résultat. [:paysan]  
 
edit: par contre si je lui rappelle sans arrêt de pas "sur-penser" ( :o ), ça réduit fortement la conso/.le gaspillage de contexte.


 
Après il faut être d'accord sur "ça marche bien", je suis OK avec un PP de 50 et tgs de 5 avec un modèle dense si ça me permet de charger un gros modèle/context. Certains diraient que c'est inutilisable.
 
T'as essayé avec le reasoning en low? Je suis passé en medium, mais j'ai pas noté de grosse différence.


---------------
Faudra que je teste un jour :o
n°46722
moyen_moin​s
chat réincarné
Posté le 29-08-2026 à 14:49:11  profilanswer
 

the_fennec a écrit :

 

Après il faut être d'accord sur "ça marche bien", je suis OK avec un PP de 50 et tgs de 5 avec un modèle dense si ça me permet de charger un gros modèle/context. Certains diraient que c'est inutilisable.

 

T'as essayé avec le reasoning en low? Je suis passé en medium, mais j'ai pas noté de grosse différence.


Y'a vraiment un gros step dans le résultat entre medium et xtrahigh je trouve. Mais même en lui disant d'y aller mollo, j'ai 38min de thinking et en medium y'a quoi, 3min je crois ? Sur le même prompt.
Donc pour les trucs standards, medium ça le fera. Mais pour les prompts où je demande quelque chose avec un "rendu visuel" (ihm etc.), je laisserai le reasoning par défaut.

n°46726
the_fennec
f3nn3cUs z3rd4
Posté le 29-08-2026 à 17:11:10  profilanswer
 

speedboyz30 a écrit :


 
Pas convaincu par le Asus. Ultra Portable avec du throttling ?
Niveau tarif le macbook pro ça chiffre beaucoup plus vite quand même.
Le bosgame est à 2600 euros en ce moment je crois :jap:  
 
J'ai vu un truc pas trop cher sur une offre de rentrée MSI Vector 17 HX AI.
 
3000 balles pour :
Free Dos
Intel Core Ultra 9 275HX
GeForce RTX 5090
17", 2560x1600 QHD+
32 GB RAM, 1 TB SSD
 
Le Mac Studio c'est sympa aussi niveau revente dans 2 ans, ça change pas mal l'équation.


 
Attention, la 5090 mobile n'a que 24GB de VRAM!
C'est un laptop gamer avec IA marqué dessus cas le CPU intel a un NPU dedans :o
 
Je prendrais pas ça pour faire de l'IA...


---------------
Faudra que je teste un jour :o
n°46727
the_fennec
f3nn3cUs z3rd4
Posté le 29-08-2026 à 17:13:11  profilanswer
 

moyen_moins a écrit :


Y'a vraiment un gros step dans le résultat entre medium et xtrahigh je trouve. Mais même en lui disant d'y aller mollo, j'ai 38min de thinking et en medium y'a quoi, 3min je crois ? Sur le même prompt.
Donc pour les trucs standards, medium ça le fera. Mais pour les prompts où je demande quelque chose avec un "rendu visuel" (ihm etc.), je laisserai le reasoning par défaut.


 
En fait le thinking ne poserait pas de soucis si c'était pas aussi lent :(


---------------
Faudra que je teste un jour :o
n°46761
neo world
Posté le 30-08-2026 à 04:15:12  profilanswer
 

Bon j'ai pas été rattrapé par la patrouille
 
https://rehost.diberie.com/Picture/Get/f/539898
 
 [:perco_35:2] :D
 
Bonne nuit maintenant :o

n°46773
the_fennec
f3nn3cUs z3rd4
Posté le 30-08-2026 à 10:14:19  profilanswer
 

Pas mal :jap:
Tu vas le mettre a faire quoi?


---------------
Faudra que je teste un jour :o
n°46777
neo world
Posté le 30-08-2026 à 10:43:13  profilanswer
 

Tout ! :D
 
J’ai fini de sécuriser talk, le git interne est prêt aussi. Prochaine étape installer hermes dans une VM à part pour le faire bosser. J’ai un premier projet de veille de journaux automatique via l’abonnement à la médiathèque.
 
J’aimerais aussi héberger un obliterate sur du pentest de mes services exposés à internet mais je vais attendre un peu avant de m’auto powned et devoir tout réparer après sans avoir profité un peu d’abord pour construire quelques softs :D

n°46778
the_fennec
f3nn3cUs z3rd4
Posté le 30-08-2026 à 10:55:15  profilanswer
 

T'as testé des gros prompts? T'es sur llama.cpp ou vLLM?


Message édité par the_fennec le 30-08-2026 à 10:55:33

---------------
Faudra que je teste un jour :o
n°46779
neo world
Posté le 30-08-2026 à 10:58:04  profilanswer
 

Llama cpp. La build d’hier soir. Je test un peu plus ce soir mais faudra sans doute attendre quelques jours avant que je puisse partager mon expérience sur les appels d’outils, les gros contextes et les tâches longues. La j’ai juste posé les fondamentaux :D
 
Comment ça tourne de ton côté ?

n°46781
the_fennec
f3nn3cUs z3rd4
Posté le 30-08-2026 à 12:03:25  profilanswer
 

Non, ça plante au bout de 365 tokens générés, j'ai ouvert un bug.
 
Je suis repassé sur Ornith 1.5.


---------------
Faudra que je teste un jour :o
n°46785
neo world
Posté le 30-08-2026 à 13:20:34  profilanswer
 

Pas de message particulier de llama quand il crash ?

n°46792
the_fennec
f3nn3cUs z3rd4
Posté le 30-08-2026 à 16:58:23  profilanswer
 

Si, il est dans le bug:
https://github.com/ggml-org/llama.cpp/issues/27939
 

Code :
  1. [graph_compute]
  2. device: 0, n_nodes: 2529, n_tensors: 3319
  3. /home/runner/work/llama.cpp/llama.cpp/ggml/src/ggml-vulkan/ggml-vulkan.cpp:8250: GGML_ASSERT(pipeline->push_constant_size == push_constant_size(push_constants)) failed
  4. /home/user/tools/llama.cpp/libggml-base.so.0(+0x1c85b) [0x7fd6f54a285b]
  5. ...


 
Je me demande si c'est pas lié a ça:
https://github.com/ggml-org/llama.cpp/pull/26500
 
La PR vient d'être approuvée, j'ai espoir que ça fix mon problème aussi. Au pire ça me permettra de faire tourner DS4  :love:  


---------------
Faudra que je teste un jour :o
n°46796
neo world
Posté le 30-08-2026 à 18:44:09  profilanswer
 

Je vois :D
 
Au fait pour ceux qui cherchent un système avec pas mal de RAM y’a un 6 cœurs / 64GB de DDR4 avec une 3060 en prime dans la catégorie achat et vente (HP Z4). C’est pas idéal mais au prix de la RAM et du slot pci express y’a peut être moyen d’en tirer quelque chose en fonction des pièces qui traînent chez vous :jap:


Message édité par neo world le 30-08-2026 à 18:44:25
n°46798
the_fennec
f3nn3cUs z3rd4
Posté le 30-08-2026 à 19:00:13  profilanswer
 

En effet, je mets le lien:
https://forum.hardware.fr/hfr/Achat [...] 9402_1.htm
 
c'est une 3070 d'ailleurs


---------------
Faudra que je teste un jour :o
n°46830
neo world
Posté le 30-08-2026 à 23:41:19  profilanswer
 

Bordel Je test tout juste openclaw. J'installe, je pointe vers mon lemonade strix halo, j'écris "hey" dans le chat ...
Input token 17000  [:elena gates:2]  
 
Bon du coup ça crash pas. C'est juste pas le problème d'openclaw tout ce qui est frugalité :o

n°46831
Tronklou
❤❤ Vrp Bambulab à mi-temps ❤❤
Posté le 30-08-2026 à 23:49:33  profilanswer
 

T'arrive après la guerre , hermess :O


---------------
Victime de girafophobie, mais se soigne.
 Page :   1  2  3  4  5  ..  49  50  51  ..  56  57  58  59  60  61

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)