| |||||
| Dernière réponse | |||
|---|---|---|---|
| Sujet : Infra IA : aide au choix et troubleshot de LLM Locaux | |||
| the_fennec |
|
||
| Aperçu |
|---|
| Vue Rapide de la discussion |
|---|
| the_fennec |
|
| neo world | AMD propose de desserrer le frein à main sur ses igpu avec le kernel linux 7.4 :
https://www.phoronix.com/review/amd-perfopt
|
| neo world | pour les accros d'halogen : https://github.com/gufo-org/gufo ne migrez pas tout de suite : c'est open source et les perfs sont encore meilleures mais le kv cache semble pas tout à fait au point encore : https://github.com/gufo-org/gufo/issues https://i.redd.it/9lw4fgl6a6sh1.png
|
| speedboyz30 |
|
| Dezerd |
|
| speedboyz30 |
|
| neo world |
|
| speedboyz30 |
2 DGX Spark [:zyzz:2] Tu devrais avoir assez je pense [:la chancla:5]
Y a pas mieux pour ça. Une conf maison pour 10 users avec 8k de budget [:leve le pied jeannot:4] |
| the_fennec |
|
| moyen_moins | Faut demander à alanou (cf. page précédente) :spamafote: |
| croustx |
|
| croustx |
|
| moyen_moins |
|
| Dezerd |
|
| Dezerd |
|
| moyen_moins |
|
| croustx |
|
| Dezerd | Salut à tous, Fans le cadre d'un projet "POC" d'un Rag + vive coding, je cherche à monter un serveur / PC. Budget de 8k€ (...) Le machin sera multi user (10 personnes). je débute dans la compréhension du concept. Y'a des tips a prendre en compte pour pas faire n'imp ? J'ai demandé aux IA qui pousse une conf maison à base de 4090 d'occaz(x2) ou une 5090. Merci |
| croustx | Dites,
Faudrait se faire une liste "meilleur rapport VRAM/prix" du matos dispo. Genre "pour 800€, j'ai de la RTX3090 sur leboncoin" |
| moyen_moins | c'est le genre de modèle à tout faire en ce qui me concerne (edit : en théorie peu rebooté, recherche améliorée, connexion HA et petits problèmes genre macro excel), pour les trucs "complexes" je me replie sur un qwen 3.8 27B sur ma config. mais je garderai ton post à l'esprit quand je ferai les tests ce soir ou demain :jap: |
| the_fennec |
|
| moyen_moins | j'ai le k en q8, le v en q5_1. je sais pas si llama.cpp prend le q6 en quant sur le kv cache [:transparency]
je vais regarder tiens :) |
| Pipould's |
|
| moyen_moins | par contre cette nuit ( :o ), j'ai continué à tester le setup bc-250 et je pense qu'il faut que je lève le pied sur la quantization du kv cache du ornith 35B unsloth (que je préfère au qwen 3.6 35B) : q8/q4 j'ai des bizarreries lors de la génération (pas fréquentes mais suffisamment pour que je m'en aperçoive). du genre caractère chinois au milieu d'un mot, mot "inventé" mais très proche de ce qu'il cherche à dire (habilité => habilisé) [:paysan] bon déjà le quant en iq4_xs est bien sans plus mais là... a priori ça continue de passer max contexte (256K) avec du q8/q5_1 et voir à l'utilisation ce qu'il en ressort. j'ai aussi trouvé du atomic chat en iq4_xs un poil plus gros et avec de meilleurs métriques mais le kv cache passe tout juste en taille max (faut pas que ça swape sinon ça devient leennnt) et leur mix iq4_xs_q4_k me fait perdre pas mal (140K max de contexte a priori) [:paysan]² |
| neo world |
|
| neo world |
|
| neo world |
|
| moyen_moins |
|
| Pipould's |
|
| alanou |
|
| Tronklou | Ca manque de scotch papier, Tronklou not approved |
| Pipould's |
Attends, jai pas assez de pc pour les mettre... https://i.ibb.co/fVnn6GZ9/IMG-20260921-192247.jpg :O |
| moyen_moins | vous faites des jaloux les mecs là :o |
| Pipould's | De mon cote j'en suis la:
https://i.ibb.co/Kc7QCNhT/image.png https://i.ibb.co/4wJXGrtW/image.png J'ai toujours pas recu les M.2 -> PCIE5 4x. Sinon en terme de generation / prefill, ca boost... Sinon mon setup a base de strix / halogen je le considere production grade, il tourne sans soucis. |
| alanou |
|
| Pipould's |
|
| alanou |
|
| Pipould's |
+1 Les V620 sont introuvables en Europe... Les cmp170 c'est la roulette russe... T'as réussi à les trouver ou ? Tu les as complètement débloquées ? |
| Bitman |
|




