| |||||
| Dernière réponse | |
|---|---|
| Sujet : Infra IA : aide au choix et troubleshot de LLM Locaux | |
| Tronklou | Impossible de faire fonctionner correctement la repartition avec unsloth desktop, a chaque fois il me met des couches cpu et ca descend a 7 tok/s :O
Quand les bc250 sont de nouveaux libre je me rabat dessus avec llama.cpp :D |
| Aperçu |
|---|
| Vue Rapide de la discussion |
|---|
| Tronklou | Impossible de faire fonctionner correctement la repartition avec unsloth desktop, a chaque fois il me met des couches cpu et ca descend a 7 tok/s :O
Quand les bc250 sont de nouveaux libre je me rabat dessus avec llama.cpp :D |
| moyen_moins | bon, qwen 3.8, pour le moment, obligé de désactiver le mode thinking car à part me bouffer mon contexte (limité), c'est inutilisable sinon.
et le machin d'unsloth là [:ograoum papas:1] |
| yohaskan | Bon j'ai retenté Qwen3.8 27B pour faire le Starfox-like, mais ce coup ci via Cline VScode , pour lui signaler les bugs
Prompt : Create a spaceship game inspired by Star Fox using vanilla Three.js and HTML. It should have at least five levels, keyboard and mouse controls, enemies, and a fully functional gameplay system. 14:27 Thinking en masse... 14.41: 1er gabarit html vide, sections J1 à J10 14:44 fin codage j1 à J4 14:47 fin codage j5 à J10 14:47 verification du code JS 14:49 I found a real bug: inside mouseToWorld() 14H50 Completed (d'après qwen...) Je lance : ok j'ai un beau menu scintillant, je lance la partie... je vois le vaisseau et l'espace qui défile... pendant 3 seconde max, avant freeze total
|
| M300A |
Bah DS4 Flash 0731, si un jour on reçoit 4 RTX6K en plus j'envisagerais un GLM voir un Kimi mais pour le moment je pense que je vais rien changer avant un moment. |
| Pipould's |
|
| Plam | vLLM team ici, même si en mono GPU, avec pas mal de concurrence (et pas qu'une usage perso sur un seul GPU), ça tourne très bien :jap: |
| neo world | Faut une grappe de GPU pour que ce soit intéressant de passer à vllm non ?
Dans les tests que j’ai vu en mono gpu llama sortait un peu plus de tokens / seconde |
| Pipould's | Team VLLM vous etes ou ? ^^
Y'a pas a dire VLLM et leur technique de prefill en meme temps que generation c'est un cran a dessus de llamacpp... |
| the_fennec | Le soucis est déjà fixé dans llama.cpp:
https://github.com/ggml-org/llama.c [...] 446bd5460a :o |
| yohaskan | Oui j'avais lu ça, Un peu étrange que la temp soit plus basse en mode instruct, mais bon s'il a été entraîné comme ça... mais je doute que ca change quoi que ce soit pour la désactivation de son raisonnement ou gestion de son effort. Donc ouais faut attendre un fix. C'est chiant ces lancement foireux (Muse n'etait pas mieux), mais en même temps ca a un coté Wild Wild West ces LLM ; on est des pionniers ;) |
| M300A |
J'imagine que le moteur est pas à jour, ou la template Jinja... Je sais que c'est tentant mais attends un peu que tout ça soit supporté correctement ;) |
| the_fennec | D'ailleurs les settings recommandés ont changé:
|
| yohaskan |
|
| the_fennec | On dirait que j'ai le même soucis, little-coder est intervenu:
https://i.imgur.com/rkANkJU.png ya un bug dans llama.cpp en plus: https://www.reddit.com/r/LocalLLaMA [...] d_to_chat/ |
| the_fennec | Si tu parles bien de Qwen 3.8, tu peux régler le thinking sur low, medium et xhigh (default).
|
| yohaskan | Pour le 1er jet, oui il avait dépassé son context limit ; je voulais voir a chaud sans réglage, comment il se comportait par default dans LM Studio
Pour le 2eme, même Context lengh de 200k, juste limité son budget de raisonnement à 2K |
| neo world | tu as mis combien en context ? il a pas juste fait un oom (crash du modèle) ou simplement dépassé son context (j'imagine que ça interompt seulement ce qu'il y avait en cours) |
| yohaskan | Moi je n'ai pas pu finir mon test de jeu style Starfox dans un "self-contained HTML file" , ca a reflechi pendant... 20mn (budget sans limite par defaut) en bouffant 109804 token de raisonnement.
Et en le limitant à 2k, hélas, le resultat n'etait pas mieux, j'ai bien un beau menu avec le message clignotant : "PRESS ENTER TO LAUNCH" mais cela ne fait ...Rien Bon j'ai pu au moins voir que ca génère à 84 token/s sur RTX5090 Mais je crains qu'on ai encore pas mal de problème d'Overthinking style... but wait... but wait... but wait... |
| Tronklou |
|
| neo world | Jamais eu besoin. A la maison je fais du LLM que sur de la LPDDR comme un manant et au boulot tout passe en fabric Nvidia [:perco_35:2] |
| Pipould's | Certains d'entre vous ont cherché des cartes bridge pcie ? Genre ça je suppose : Ich habe das hier gerade auf AliExpress gefunden: L'idée est d'apporter du pcie 5.0 a une carte et laisser les gpu parler entre eux a 4.0 16x. |
| Pipould's |
L'idée c'est d'avoir plusieurs modèles dans un pipeline que tu n'utilise pas en même temps. Comme car ils sont tous en mémoire avec leur cache prefil et tu ne perds pas de temp a les charger ou en pp. |
| Tronklou | Là je test sur le pc avec la 3060 et la 5070ti, mais j'ai un soucis avec unsloth desktop : il décharge une partie en cpu donc ca s'écoule....
Je vais repartir de llama.cpp pour régler ca correctement |
| the_fennec | J'ai l'impression que le pp est plus lent; la je suis a 100k de contexte et 60 t/s, je pense qu'en 3.6 j'étais dans les 100/s.
C'est peut être que j'ai repassé une BC250 en 24cu. |
| Tronklou |
|
| neo world | Oh bordel :love: |
| moyen_moins | Je viens de voir les tailles, q6 ud xl ça va pas passer sur mes 2x16gb (ou alors avec off load mais perf bof bof) :/ Ou alors contexte <32 (pas d'intérêt). Je testerai le q6 simple, je sais pas si l'ud xl apporte réellement quelque chose à ces niveaux de quantization. |
| the_fennec | Je l'ai mis au taf, on verra demain!
En tout cas, il semble plus rapide, moins gros, thinking configurable, MTP de base, du tout bon. Je pense qu'on va pouvoir mettre Muse au placard :o |
| Olivie | Ca y est, on peut faire tourner opus 4.6 en local ? :o |
| the_fennec | Qwen3.8-27B-UD-Q8_K_XL avec MTP de base, 4GB de moins que 3.6
https://progressive-gale-c3jf.pagedrop.io 13 tg/s 5min de génération :love: pour rappel:
|




