| |||||
| Auteur | Sujet : Infra IA : aide au choix et troubleshot de LLM Locaux |
|---|---|
neo world |
the_fennec f3nn3cUs z3rd4 |
--------------- Faudra que je teste un jour :o |
neo world | En q-1 donc |
neo world |
Message cité 1 fois Message édité par neo world le 03-09-2026 à 21:33:45 |
the_fennec f3nn3cUs z3rd4 |
--------------- Faudra que je teste un jour :o |
M300A |
Sur des trucs --------------- :wq |
moyen_moins chat réincarné |
|
b-tzu Geek a toute heure... |
--------------- Topic Ventes || Topic Jeux Vidéos || Topic Téléphonie (Rien pour le moment) |
moyen_moins chat réincarné | Fork pour kv cache partiel offload + streaming en memoire https://github.com/RaymondHuang2101 [...] -streaming Message édité par moyen_moins le 03-09-2026 à 23:48:21 |
neo world |
|
the_fennec f3nn3cUs z3rd4 |
--------------- Faudra que je teste un jour :o |
M300A |
J'ai toujours pas vu la machine, j'y passe lundi pour réinstaller sur une grappe de SSD et rajouter de la ram, voir mettre deux RTX6k en plus si c'est arrivé mais je crois pas --------------- :wq |
neo world |
|
the_fennec f3nn3cUs z3rd4 |
Message cité 1 fois Message édité par the_fennec le 03-09-2026 à 23:48:05 --------------- Faudra que je teste un jour :o |
neo world |
|
Pipould's |
C'est fou, j'ai: - Un dual 3090 +32gb de ddr5. Qui va peut être pouvoir faire tourner des gros modèles Avant les 2 premiers me semblaient utilisable mais la avoir des modèles sur 16Gb de vram ça change la donne.
|
neo world | je vous répond depuis l'an de grâce 2028 où tout le monde à son agent swarm sur des téléphones. On ne sait plut trop bien comment la tradition a démarré mais il y a une moyenne de 6M de nouveaux clones de flappy bird par seconde et aucun moyen de stopper la tendance |
neo world |
Message cité 1 fois Message édité par neo world le 04-09-2026 à 00:29:27 |
Pipould's |
Lol Tu rigoles mais avec un cap a 100usd par mois en tokens... Je dois faire ca par jour juste sur les 3090's |
neo world | j'aimerais en dire autant : 2,2M de tokens en input, 1M en output sur en gros 24h.
|
neo world | du coup nouveau sondage |
M300A | J'ai mon glm qui tourne quasi autonome dans OpenCode, il a bossé pendant 3h environ pour me faire des corrélations et des rapports sur des données. Je lui ai redonné quelques input sur des problèmes qu'il a identifié mais qui n'en sont pas pour qu'il affine ses livrables Je le laisse de nouveau en autonomie pour la nuit, je lui ai demandé de me générer des rapports avec des fonds de carte et tout C'est quand même au dessus de DS4 Flash --------------- :wq |
neo world |
|
seu M 41 | Hello ! |
M300A | Oui c'est le bon endroit ! Tu dois commencer par expliquer ce que tu as comme hardware et quels sont tes besoins (relecture de doc en langues EU ?) --------------- :wq |
seu M 41 |
Message cité 2 fois Message édité par seu le 04-09-2026 à 10:16:03 |
M300A | Je ne suis pas spécialiste mais je pense que ça va être difficile, je ne crois pas que tu puisses faire grand chose sous les 32/64Gb de VRAM, et même si Gemini c'est de la merde, ça sera quand un même un massive downgrade Mais il y a pas mal de gens qui bricolent ici et qui pourront t'en dire plus --------------- :wq |
M300A |
Rapport visualisé un peu ce matin, et je comprends mieux les retours de certains collègues, il a du mal à parler d'autre chose que de code et son français est spécial Il a aussi été paresseux avec la vision, beaucoup de cartes sont illisibles avec des overlaps un peu partout. Deuxième passe en cours, je vois dans le thinking qu'il en chie --------------- :wq |
seu M 41 |
|
M300A |
Pour moi là ou ça commence à être sympa c'est deux RTX6000 Pro BW 96Gb. Avec ça tu peux faire tourner un DeepSeek Flash v4 0731. Pour le faire tourner, une Debian, VLLM, un reverse proxy par dessus et pas de soucis. Quand c'est des cas particuliers t'as des communautés qui compilent des VLLM custom et mettent ça dans des dockers. --------------- :wq |
SynE Agri du dessert |
|
the_fennec f3nn3cUs z3rd4 |
--------------- Faudra que je teste un jour :o |
lapin | Méfiez-vous d'après Windows Defender y a pas mal de Virus dans les repos de https://github.com/ggml-org/llama.cpp/releases
|
seu M 41 |
|
moyen_moins chat réincarné | y'a eu des poc de streaming du cache kv depuis la RAM, ça évite que la génération se casse la gueule.
|
the_fennec f3nn3cUs z3rd4 |
--------------- Faudra que je teste un jour :o |
seu M 41 |
|
SynE Agri du dessert | Carrément mieux |

| Sujets relatifs | |
|---|---|
| [Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & co | sécurité de l'IA / agentique et des Devs en roue libre |
| Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux | |




