Forum |  HardWare.fr | News | Articles | PC | S'identifier | S'inscrire | Shop Recherche
3033 connectés 

 


Je génère ...
Sondage à 3 choix possibles.
Ce sondage expirera le 20-09-2026 à 10:00




Attention si vous cliquez sur "voir les résultats" vous ne pourrez plus voter

 Mot :   Pseudo :  
  Aller à la page :
 
 Page :   1  2  3  4  5  ..  51  52  53  ..  56  57  58  59  60  61
Auteur Sujet :

Infra IA : aide au choix et troubleshot de LLM Locaux

n°46905
the_fennec
f3nn3cUs z3rd4
Posté le 31-08-2026 à 13:15:32  profilanswer
 

Reprise du message précédent :

epsiloncentaury a écrit :


 
J'ai pas dit que je voulais faire du sli. Le sli ne sert à rien dans l'AI. Et j'ai pas la carte pour faire du sli.


 
Au contraire le SLI est très utile pour l'IA, ça te permet d'avoir une BP bien plus élevée que le bus PCIe.  
Si tu mets tes cartes en split-mode=tensor tu pourrais avoir un bon gain en PP et TG.
 
Après c'est la théorie, je sais pas trop ce que ça donne, surtout avec des 1080.


---------------
Faudra que je teste un jour :o
n°46906
the_fennec
f3nn3cUs z3rd4
Posté le 31-08-2026 à 13:17:48  profilanswer
 

AllenMadison a écrit :


 
On verra bien, la ddr6 est toujours prévue (et la ddr7 aussi) d'après AMD. A voir si on n'aura pas tout directement avec de la hbm :o


 
La HBM n'a aucun intérêt pour replacer de la DDR (ou de la GDDR), la latence est beaucoup trop élevée, elle coûte plus chère et le gain en BP est inutile.


---------------
Faudra que je teste un jour :o
n°46913
lapin
Posté le 31-08-2026 à 13:39:58  profilanswer
 

the_fennec a écrit :


 
La HBM n'a aucun intérêt pour replacer de la DDR (ou de la GDDR), la latence est beaucoup trop élevée, elle coûte plus chère et le gain en BP est inutile.


 
 
Gemini en Mode Pro réflexion étendu dit ceci: https://share.gemini.google/Kdg1UGscEoBJ
 
Génération,Latence typique (estimée),Bande passante (par puce/pile),Architecture du Bus
HBM1,~30 ns,128 Go/s,1024-bit (Très large)
HBM2 / 2E,~32 - 34 ns,256 à 460 Go/s,1024-bit
HBM3 / 3E,~35 ns,819 à 1 200 Go/s,1024-bit
HBM4 (2026+),~36 ns,1 500 à 2 000+ Go/s,2048-bit
,,,
GDDR5,~45 ns,32 Go/s,32-bit (Étroit)
GDDR5X,~48 ns,40 à 56 Go/s,32-bit
GDDR6,~52 ns,56 à 72 Go/s,32-bit
GDDR6X,~55 ns,76 à 94 Go/s,32-bit
GDDR7,~50 ns,112 à 128 Go/s,32-bit
 
Pour comprendre la latence de ces différentes mémoires, il faut d'abord saisir la différence fondamentale de conception entre la famille HBM et la famille GDDR.
 
HBM (High Bandwidth Memory) : C'est une autoroute extrêmement large (jusqu'à 2048 voies) avec une limite de vitesse modérée.
GDDR (Graphics Double Data Rate) : C'est une route très étroite (32 voies par puce) mais avec une limite de vitesse colossale.
 
La latence absolue (le temps physique réel mesuré en nanosecondes entre une requête du processeur et l'arrivée des données) dépend des cellules de mémoire (DRAM), de la distance physique, et du temps de traitement du signal (contrôleur et correction d'erreurs).
 
 HBM : Une latence structurellement plus basse
 
La famille HBM (de la HBM1 à la future HBM4) maintient une latence absolue très basse et stable, généralement comprise entre 30 et 40 nanosecondes (ns).
 
Cela s'explique principalement par son intégration physique :
 
1. Proximité extrême : La mémoire HBM est empilée en 3D et placée sur le même interposer (substrat de silicium) que le processeur graphique (GPU). La distance électrique n'est que de quelques centaines de micromètres (contre plusieurs centimètres pour la GDDR).
2. Fréquences basses : Parce que le bus est immense grâce aux connexions verticales TSV (*Through-Silicon Vias*), la mémoire n'a pas besoin de tourner à des fréquences extrêmes pour fournir une bande passante massive. Cela simplifie grandement le travail du contrôleur mémoire et réduit le temps de traitement.
 
GDDR : Le prix de la fréquence
 
Les mémoires GDDR ont une latence absolue plus élevée, qui se situe généralement entre 40 et 60 nanosecondes (ns).
 
Paradoxalement, à mesure que les générations avancent et que la bande passante explose, la latence n'a pas diminué de manière drastique. Elle a même eu tendance à légèrement augmenter à cause de la complexité du signal :
 
GDDR5 et GDDR5X (~45 à 50 ns) : La latence était gérée par des fréquences très élevées mais des signaux électriques relativement simples (NRZ - Non-Return-to-Zero).
GDDR6 et GDDR6X (~50 à 60 ns) : Pour atteindre des vitesses extrêmes (jusqu'à 24 Gbps par broche), ces mémoires utilisent des encodages complexes. La GDDR6X, développée par Micron et NVIDIA, introduit le signal PAM4 (qui transmet 2 bits par cycle). Coder, décoder et vérifier les erreurs (CRC) de ce signal à travers les pistes d'un circuit imprimé ajoute un léger surcoût de temps de traitement.
GDDR7 (~45 à 55 ns) : La nouvelle norme utilise un signal PAM3. Bien qu'elle double la bande passante par rapport à la GDDR6, les optimisations du contrôleur et de l'architecture permettent de maintenir, voire de réduire très légèrement, la latence par rapport à la GDDR6X.
 
---
 
 Le cas de la "GDDR7X"
 
La GDDR7X n'existe pas à l'heure actuelle.
La désignation "X" (comme pour la GDDR5X et la GDDR6X) était historiquement utilisée pour marquer des collaborations spécifiques (souvent entre Micron et NVIDIA) visant à devancer les standards officiels du JEDEC. La norme officielle GDDR7 ayant déjà intégré nativement des technologies très avancées comme le PAM3 pour atteindre 32 Gbps par broche, une déclinaison "7X" n'est ni standardisée ni officiellement annoncée à ce jour.
 
---
 
Comparatif : Latence vs Bande Passante
 
Voici comment ces générations se positionnent en termes de compromis entre la latence typique estimée et la bande passante maximale délivrée par puce (pour la GDDR) ou par pile (pour la HBM) :
 
| Génération | Latence typique (estimée) | Bande passante (par puce/pile) | Architecture du Bus |
| --- | --- | --- | --- |
| HBM1 | ~30 ns | 128 Go/s | 1024-bit (Très large) |
| HBM2 / 2E | ~32 - 34 ns | 256 à 460 Go/s | 1024-bit |
| HBM3 / 3E | ~35 ns | 819 à 1 200 Go/s | 1024-bit |
| HBM4 (2026+) | ~36 ns | 1 500 à 2 000+ Go/s | 2048-bit |
|  |  |  |  |
| GDDR5 | ~45 ns | 32 Go/s | 32-bit (Étroit) |
| GDDR5X | ~48 ns | 40 à 56 Go/s | 32-bit |
| GDDR6 | ~52 ns | 56 à 72 Go/s | 32-bit |
| GDDR6X | ~55 ns | 76 à 94 Go/s | 32-bit |
| GDDR7 | ~50 ns | 112 à 128 Go/s | 32-bit |
 
(Note : La latence de bout en bout dépend toujours de l'architecture spécifique du contrôleur mémoire du processeur, des timings exacts et des fréquences appliquées, mais l'écart structurel entre HBM et GDDR reste constant).
 
 
 
Donc je pense que le cout prohibitif de la HBM interdit ou limite fortement l'utilisation de HBM3 ou de HBM4 et ses variantes, mais la latence n'est clairement pas un problème, c'est surtout que c'est horriblement cher à produire et donc à acheter.

n°46915
moyen_moin​s
chat réincarné
Posté le 31-08-2026 à 13:52:50  profilanswer
 

the_fennec a écrit :


 
Perso j'ai juste ça: --spec-type draft-mtp --spec-draft-n-max 2


c'est ce que j'utilisais mais j'avais lu pas mal de tests où le n max à 3 était le sweet spot.
faut que je teste tout ça :jap:

AllenMadison a écrit :


 
Plus de ram et une bande passante légèrement meilleure, même si 273gb de bande passante c'est seulement 6% par rapport aux 395
 
Idéalement il faudrait 256gb de ram + 1700gb de bande passante \o/


et tout ça pour le double du prix actuel :o

n°46920
neo world
Posté le 31-08-2026 à 14:39:51  profilanswer
 

AllenMadison a écrit :


 
Plus de ram et une bande passante légèrement meilleure, même si 273gb de bande passante c'est seulement 6% par rapport aux 395
 
Idéalement il faudrait 256gb de ram + 1700gb de bande passante \o/


Mac studio ultra  [:benzema_is_useless]

n°46921
speedboyz3​0
Guide Michelin :o
Posté le 31-08-2026 à 14:41:15  profilanswer
 

neo world a écrit :

Perso je vais en venir à ce qui était prévu à peu prêt au départ : un modèle frontier en cloud pour la discussion / planification / revue de code / orchestration avec peu de droits (lecture sur la code base) et un modèle local pour le coding / pentest / trucs que refuseront de faire les vendeurs cloud.


 
Clairement ça ne me dérange pas de payer un frontier en cloud pour de 20 à 100 balles par mois.
 
Mais quand tu commences à exploser des quotas, te retrouver bloqué sur des API pour faire tourner tes agents, devoir raquer encore xx euros pour faire des images / vidéos qui tiennent la route, ça commence à faire chier.  
 

n°46922
neo world
Posté le 31-08-2026 à 14:56:14  profilanswer
 

speedboyz30 a écrit :


 
Clairement ça ne me dérange pas de payer un frontier en cloud pour de 20 à 100 balles par mois.
 
Mais quand tu commences à exploser des quotas, te retrouver bloqué sur des API pour faire tourner tes agents, devoir raquer encore xx euros pour faire des images / vidéos qui tiennent la route, ça commence à faire chier.  
 


Oui et puis quand tu es coincé avec des fournisseurs dont le modèle économique est extrêmement déficitaire tu sais que ça attend que la concurrence se tarisse avant de t'allumer pour récupérer la mise.  
 
Pour ça les avancées de Qwen sont quand même assez dingues (diminution des coûts d'entrainement par 9, changement d'architecture pour faciliter l’hébergement sur une infrastructure en tiers VRAM / RAM / NVME ). Au global on prend quand même une sacrée leçon par rapport à d'habitude où les boites de la tech américaine survolent sans effort particulier le domaine

n°46923
the_fennec
f3nn3cUs z3rd4
Posté le 31-08-2026 à 15:12:06  profilanswer
 

Je teste Qwent Next en IQ4_ZS avec 65k de contexte:
https://huggingface.co/AtomicChat/Q [...] -Next-GGUF
 
Par contre il faut que je repense ma gestion de mémoire avec Qwen4:

Code :
  1. 0.00.700.795 I load_tensors: loading model tensors, this can take a while... (load_mode = none)
  2. 0.00.768.631 I add: tensor per_layer_token_embd.weight (size = 36621 MiB) lazy read enabled
  3. 0.03.087.868 I load_tensors: offloading output layer to GPU
  4. 0.03.087.881 I load_tensors: offloading 47 repeating layers to GPU
  5. 0.03.087.882 I load_tensors: offloaded 49/49 layers to GPU
  6. 0.03.087.889 I load_tensors: RPC0[arisu:50000] model buffer size = 13695.43 MiB
  7. 0.03.087.891 I load_tensors: RPC0[lain:50000] model buffer size = 13686.11 MiB
  8. 0.03.087.894 I load_tensors:      Vulkan0 model buffer size = 14463.98 MiB
  9. 0.03.087.896 I load_tensors:  Vulkan_Host model buffer size =  2519.14 MiB
  10. 0.03.087.897 I load_tensors:   CPU_Mapped model buffer size = 36621.27 MiB


 
Avant "CPU_Mapped model" c'était ce qui serait pris en RAM avec les MoE mais maintenant, on dirait que c'est juste les ngram. Vulkan_Host C'est le MoE, donc (encore) plus difficile de prédire la répartition mémoire.
Je tiens les 9.5 tg/s pour le moment.


---------------
Faudra que je teste un jour :o
n°46924
the_fennec
f3nn3cUs z3rd4
Posté le 31-08-2026 à 15:19:00  profilanswer
 

neo world a écrit :

Pour ça les avancées de Qwen sont quand même assez dingues (diminution des coûts d'entrainement par 9, changement d'architecture pour faciliter l’hébergement sur une infrastructure en tiers VRAM / RAM / NVME ). Au global on prend quand même une sacrée leçon par rapport à d'habitude où les boites de la tech américaine survolent sans effort particulier le domaine


 
Comme c'est partis ils vont nous faire tourner Qwen4 35B sur un téléphone :o
 
https://i.imgur.com/C2L6lEo.png
 
Qwen 3.8 Flash Next locally on simple mobile phone at 3.5 tok/s
https://www.reddit.com/r/LocalLLaMA [...] ile_phone/
 
https://github.com/Helldez/BigMoeOnEdge
 
Pas testé :o


---------------
Faudra que je teste un jour :o
n°46925
neo world
Posté le 31-08-2026 à 15:21:10  profilanswer
 

Je vous présente mon nouvel agent swarm.
 
https://external-content.duckduckgo.com/iu/?u=https%3A%2F%2Fi.ytimg.com%2Fvi%2F3bYOCovyEYU%2Fmaxresdefault.jpg&f=1&nofb=1&ipt=aca37d910a036d1114a9a83616355c9ea7c7bd571e41d7371e6feb74e7fdf679
 
Le nouveau prix des smartphones dans un mois [:laroa] :o

n°46927
speedboyz3​0
Guide Michelin :o
Posté le 31-08-2026 à 15:28:17  profilanswer
 

Mon calcul du moment :
 
Un Studio M5 Max 18c CPU / 40c GPU / 64Go ram / 512 Go SSD c'est le sweet spot je pense [:zyzz:1]  
4000 balles mais ça se revend 2000 disons dans 3 ans.
 
Ça ne coûte donc que réellement 56 euros par mois  [:la chancla:1]  
Et au tarif edu ça fait 49 euros par mois (achat à 3750 euros).
 
Est-ce que ça reste cher ? Oui.  
Est-ce que c'est hors de prix ? Non.
 
Voilà  [:leve le pied jeannot:1]  
 

n°46928
neo world
Posté le 31-08-2026 à 15:33:03  profilanswer
 

speedboyz30 a écrit :

Mon calcul du moment :
 
Un Studio M5 Max 18c CPU / 40c GPU / 64Go ram / 512 Go SSD c'est le sweet spot je pense [:zyzz:1]  
4000 balles mais ça se revend 2000 disons dans 3 ans.
 
Ça ne coûte donc que réellement 56 euros par mois  [:la chancla:1]  
Et au tarif edu ça fait 49 euros par mois (achat à 3750 euros).
 
Est-ce que ça reste cher ? Oui.  
Est-ce que c'est hors de prix ? Non.
 
Voilà  [:leve le pied jeannot:1]  
 


Déconne pas mets lui au moins 1TB de stockage. Ca pèse tous ces modèles  [:bakk38]

n°46929
speedboyz3​0
Guide Michelin :o
Posté le 31-08-2026 à 15:35:09  profilanswer
 

NVME SSD en TB?
 
300 balles pour 512go de plus quand même :/
 
Mais oui c'est peanuts sur l'ensemble :o

n°46930
neo world
Posté le 31-08-2026 à 15:37:23  profilanswer
 

Si la nouvelle archi de Qwen est efficace et est massivement adoptée par les autres tu me remerciera parce que c'est pas non plus tes 64GO qui vont permettre de tout mettre en RAM :o

n°46931
speedboyz3​0
Guide Michelin :o
Posté le 31-08-2026 à 15:38:26  profilanswer
 

neo world a écrit :

Si la nouvelle archi de Qwen est efficace et est massivement adoptée par les autres tu me remerciera parce que c'est pas non plus tes 64GO qui vont permettre de tout mettre en RAM :o


 
Pas compris :o

n°46935
Amonchakai
Posté le 31-08-2026 à 15:46:11  profilanswer
 

Faut aussi prendre 128 go de ram  :o

n°46936
neo world
Posté le 31-08-2026 à 15:47:09  profilanswer
 

y'a depuis quelques mois un mouvement vers une architecture en étage :  
1 la partie routage entre experts en VRAM
2 La partie chaude des experts en RAM (les deux sont unifiés sur ton futur Mac Studio)
3 la partie plus froide (experts peu utilisés genre les compétences en macramé pour une tâche de développement) en SSD
 
Avec 512GB tu vas pleurer. Le sweetspot est probablement à 2tb mais vu que la puce flash est vendu au poids de l'or par Apple :o

n°46938
the_fennec
f3nn3cUs z3rd4
Posté le 31-08-2026 à 15:49:30  profilanswer
 

neo world a écrit :

Je vous présente mon nouvel agent swarm.
 
https://external-content.duckduckgo [...] 74e7fdf679
 
Le nouveau prix des smartphones dans un mois [:laroa] :o


 
Tu rigoles, mais une seule colonne de S26 ça serait 84 GB de LPDDR5X, 1TB pour un panel complet. 8TB visibles sur la photo :pt1cable:


---------------
Faudra que je teste un jour :o
n°46944
moyen_moin​s
chat réincarné
Posté le 31-08-2026 à 15:57:46  profilanswer
 

Ouais donc un strix halo avec une carte 20-32gb en usb4 et roulez jeunesse alors pour qwen 4 preview flash next 120B , :whistle:

n°46946
neo world
Posté le 31-08-2026 à 16:00:21  profilanswer
 

c'est quasi ça ouais :D
 

Citation :

Most LLMs you can describe with two numbers: parameter count and how much VRAM you need. Qwen 3.8 Flash Next has three distinct memory pools that behave completely differently:
 
    Active transformer weights (~54.5 GB): These need fast memory (GTT / GPU-accessible RAM). This is the part that acts like a normal model.
    N-gram embedding table (~38.4 GB): A lookup table of 20 million bigram/trigram entries, read once per forward pass at ~2.7 KB per token. At typical generation rates that’s ~3 MB/s of random reads. It does not need fast memory and pages cleanly from SSD via mmap.
    KV cache: QSA uses a fixed 512-block, 2048-token attention budget, so KV cache growth is sublinear. Going from 32K to 131K context costs only ~3 GiB more GTT, not the ~16 GiB you’d expect from a standard attention model.
 
This three-pool layout is the key to running a 125B model on 128 GB. You only need ~55 GB of fast memory for the weights that matter, the 38 GB n-gram table trickles in from NVMe, and the KV cache barely grows with context.

n°46948
speedboyz3​0
Guide Michelin :o
Posté le 31-08-2026 à 16:05:40  profilanswer
 

Amonchakai a écrit :

Faut aussi prendre 128 go de ram  :o

 

Le 128Go est trop proche du Ultra 96Go.
Donc autant prendre le Ultra :o

 

2x plus bande passante RAM
96Go de RAM donc de la place pour des agents avec beaucoup de contexte (avec 2 users en //)
1To SSD
+50% de CPU / +50% GPU

 

On commence à causer :o

 

Ça revient à 81 euros par mois (achat @edu store à 6200, revente à 3300 - 50% du prix public, amortissement 36 mois) [:la chancla:1]  [:leve le pied jeannot:1]


Message édité par speedboyz30 le 31-08-2026 à 16:06:06
n°46959
the_fennec
f3nn3cUs z3rd4
Posté le 31-08-2026 à 16:46:34  profilanswer
 

Flappy bird
Qwen3.8-Flash-Next-AD-3.84bpw-IQ4_XS-M64
https://dochost.co/d/qbc2aq6i?v=c
 

Code :
  1. 42k tokens, 1h20, 8.8 tg/s


 
https://i.imgur.com/J8ynuKL.png


Message édité par the_fennec le 31-08-2026 à 16:47:36

---------------
Faudra que je teste un jour :o
n°46972
SynE
Agri du dessert
Posté le 31-08-2026 à 17:42:28  profilanswer
 

J'ai un serveur avec une paire de xeon gold 6138 (skylake, deux unites avx 512 par cpu), je me doute que c'est pas rapide pour faire tourner un llm, mais je peux avoir 384Go de ram.
 
Ca peut se tenter pour faire tourner un gros gros modèle ?

n°46982
tfpsly
Sly
Posté le 31-08-2026 à 17:57:01  profilanswer
 

the_fennec a écrit :

 

Cool ça progresse bien :jap:

 

Je te conseille d'essayer de passer en --cache-type-k q8_0 --cache-type-v q8_0 si possible, ça fait une bonne différence sur la qualité du contexte.


Entre 37 et 40tk/s, je vais tester ça quelques jours pour voir si ça a un effet sur le code généré.

Message cité 1 fois
Message édité par tfpsly le 31-08-2026 à 18:05:32
n°46990
the_fennec
f3nn3cUs z3rd4
Posté le 31-08-2026 à 18:47:51  profilanswer
 

SynE a écrit :

J'ai un serveur avec une paire de xeon gold 6138 (skylake, deux unites avx 512 par cpu), je me doute que c'est pas rapide pour faire tourner un llm, mais je peux avoir 384Go de ram.
 
Ca peut se tenter pour faire tourner un gros gros modèle ?


 
Il y a ik_llama qui est dédié au CPU, il supporte les gros modèles:
https://github.com/ikawrakow/ik_llama.cpp
 
Sinon Colibri
https://github.com/JustVugg/colibri
 
Par contre coté perfs, ça risque de piquer fort. Pour schématiser, ta config a 40 cores / 80 threads, une RTX 3060 en a 3584.
 
Donc si tu as le matos et que tu vas pas dépenser d'argent, ça se tente, je suis curieux du résultat!
 

tfpsly a écrit :

Entre 37 et 40tk/s, je vais tester ça quelques jours pour voir si ça a un effet sur le code généré.


 
Belle progression :jap:


---------------
Faudra que je teste un jour :o
n°46997
SynE
Agri du dessert
Posté le 31-08-2026 à 19:44:01  profilanswer
 

the_fennec a écrit :


 
Il y a ik_llama qui est dédié au CPU, il supporte les gros modèles:
https://github.com/ikawrakow/ik_llama.cpp
 
Sinon Colibri
https://github.com/JustVugg/colibri
 
Par contre coté perfs, ça risque de piquer fort. Pour schématiser, ta config a 40 cores / 80 threads, une RTX 3060 en a 3584.
 
Donc si tu as le matos et que tu vas pas dépenser d'argent, ça se tente, je suis curieux du résultat!
 


 
Je me doute que les perfs vont être pas folles, mais en effet j'ai le matos donc il faut juste que je le sorte du garde meuble et que je le branche.
 
Je viendrais raconter ce que ça donne, je me dis qu'à défaut de rapidité, je n'aurais pas d'out of memory avec un gros contexte.

n°47002
b-tzu
Geek a toute heure...
Posté le 31-08-2026 à 20:42:53  profilanswer
 

On peut faire quoi sur un macbook air M3/24Go ? C'est interessant ?  
Et sur une 3090 24Go aussi du coup ?  
Un Qwen 27B ca peut tourner sur l'un/l'autre ?


---------------
Topic Ventes || Topic Jeux Vidéos || Topic Téléphonie (Rien pour le moment)
n°47005
the_fennec
f3nn3cUs z3rd4
Posté le 31-08-2026 à 20:54:14  profilanswer
 

b-tzu a écrit :

On peut faire quoi sur un macbook air M3/24Go ? C'est interessant ?  
Et sur une 3090 24Go aussi du coup ?  
Un Qwen 27B ca peut tourner sur l'un/l'autre ?


 
Tu mets les deux en RPC avec llama.cpp et tu es le roi du pétrole :o


---------------
Faudra que je teste un jour :o
n°47007
neo world
Posté le 31-08-2026 à 20:55:45  profilanswer
 

b-tzu a écrit :

On peut faire quoi sur un macbook air M3/24Go ? C'est interessant ?  
Et sur une 3090 24Go aussi du coup ?  
Un Qwen 27B ca peut tourner sur l'un/l'autre ?


un modèle 16GO passe dessus. C'est pas parfait (idéalement tu voudrais 64GO pour que ça respire avec de plus gros modèles voir 48GO) mais y'a pire :jap:
la 3090 me semble plus intéressante (tu peux utiliser les 24GO pour ton modèle et ce sera plus rapide en prime)

n°47008
moyen_moin​s
chat réincarné
Posté le 31-08-2026 à 20:59:18  profilanswer
 

the_fennec a écrit :

 

Tu mets les deux en RPC avec llama.cpp et tu es le roi du pétrole :o


Donc du coup, si j'investis dans une carte 32GB, avec le bc-250 et sa carte de 16GB, en RPC je fais tourner qwen 3.8 next Flash next épouse alors :o

n°47009
b-tzu
Geek a toute heure...
Posté le 31-08-2026 à 21:00:06  profilanswer
 

Tres tres dur de trouver un mac en > de 24Go a des prix pas stratosphériques (32 jai rien trouvé a moins de 1400€ grand minimum)
Et le GPU, cest le meilleur rapport ram/prix je crois, plus que ca j'ai pas comment justifier

 

Et je sais pas comment mettre les deux en RPC, la 3090 est sur un fixe windows 5900X/32Go :o

Message cité 2 fois
Message édité par b-tzu le 31-08-2026 à 21:00:56

---------------
Topic Ventes || Topic Jeux Vidéos || Topic Téléphonie (Rien pour le moment)
n°47010
neo world
Posté le 31-08-2026 à 21:03:03  profilanswer
 

b-tzu a écrit :

Tres tres dur de trouver un mac en > de 24Go a des prix pas stratosphériques (32 jai rien trouvé a moins de 1400€ grand minimum)
Et le GPU, cest le meilleur rapport ram/prix je crois, plus que ca j'ai pas comment justifier
 
Et je sais pas comment mettre les deux en RPC, la 3090 est sur un fixe windows 5900X/32Go :o


Moi je te conseille de démarrer sur la 3090 et si tu accroches bien peut être acheter un bsc250 en parallèle ou une seconde 3090 (avec le nvlink :love:)

n°47011
b-tzu
Geek a toute heure...
Posté le 31-08-2026 à 21:04:26  profilanswer
 

Pour la deuxieme 3090 cest pas demain la veille, deja faut adapter boitier/alim/carte mere, acheter le gpu... le BC250 faudra voir les avantages qu'il m'apporte


---------------
Topic Ventes || Topic Jeux Vidéos || Topic Téléphonie (Rien pour le moment)
n°47014
the_fennec
f3nn3cUs z3rd4
Posté le 31-08-2026 à 21:06:06  profilanswer
 

moyen_moins a écrit :


Donc du coup, si j'investis dans une carte 32GB, avec le bc-250 et sa carte de 16GB, en RPC je fais tourner qwen 3.8 next Flash next épouse alors :o


 
Le PP est pas top quand même, j’arrive péniblement a 50/s.


---------------
Faudra que je teste un jour :o
n°47015
the_fennec
f3nn3cUs z3rd4
Posté le 31-08-2026 à 21:08:46  profilanswer
 

b-tzu a écrit :

Tres tres dur de trouver un mac en > de 24Go a des prix pas stratosphériques (32 jai rien trouvé a moins de 1400€ grand minimum)
Et le GPU, cest le meilleur rapport ram/prix je crois, plus que ca j'ai pas comment justifier
 
Et je sais pas comment mettre les deux en RPC, la 3090 est sur un fixe windows 5900X/32Go :o


 
Par le réseau :D
 
ggml-rpc-server -p 5000 d'un coté
llama-server -rpc host:5000 de l'autre
 
Ca cumule la VRAM des deux hosts.


---------------
Faudra que je teste un jour :o
n°47019
M300A
Posté le 31-08-2026 à 21:19:18  profilanswer
 

hf download local-inference-lab/GLM-5.3-Flash-NVFP4

 

[:klm]


Message édité par M300A le 31-08-2026 à 21:19:31

---------------
:wq
n°47020
b-tzu
Geek a toute heure...
Posté le 31-08-2026 à 21:20:42  profilanswer
 

the_fennec a écrit :


 
Par le réseau :D
 
ggml-rpc-server -p 5000 d'un coté
llama-server -rpc host:5000 de l'autre
 
Ca cumule la VRAM des deux hosts.


Purée cest possible ca ! folie !  
Et ca permets d'utiliser des modeles de fou ?  
quoi comme modeles en 24 et quoi en RPC ? (je sais qu'il yen a des dizaines, mais je parle des plus connus, surtout qwen 3.8)


---------------
Topic Ventes || Topic Jeux Vidéos || Topic Téléphonie (Rien pour le moment)
n°47023
the_fennec
f3nn3cUs z3rd4
Posté le 31-08-2026 à 21:27:15  profilanswer
 

b-tzu a écrit :


Purée cest possible ca ! folie !  
Et ca permets d'utiliser des modeles de fou ?  
quoi comme modeles en 24 et quoi en RPC ? (je sais qu'il yen a des dizaines, mais je parle des plus connus, surtout qwen 3.8)


 
Ben regarde mes posts :o
J'ai une 4060Ti 16GB et deux BC250 soit 44GB de VRAM en gros et je viens de charger Qwen next

Message cité 1 fois
Message édité par the_fennec le 31-08-2026 à 21:50:19

---------------
Faudra que je teste un jour :o
n°47026
tfpsly
Sly
Posté le 31-08-2026 à 22:10:04  profilanswer
 

the_fennec a écrit :

Belle progression :jap:


Merci. Mais... pi.dev a du mal à debugger mon projet avec un contexte de 32k. Je suis obligé de monter à 45k, et n'avoir que 30tk/s, pour avoir un agent plus compétent. A explorer plus - peut-être un pb dans ma config de pi.dev, qui compresse le contexte trop vite ou mal... Mais je monte rapidement à 64% d'utilisation du contexte.

Message cité 3 fois
Message édité par tfpsly le 31-08-2026 à 22:11:21
n°47028
SynE
Agri du dessert
Posté le 31-08-2026 à 22:55:12  profilanswer
 

the_fennec a écrit :


 
Ben regarde mes posts :o
J'ai une 4060Ti 16GB et deux BC250 soit 44GB de VRAM en gros et je viens de charger Qwen next


 
J'ai deux bc250 mais en load balancing ...  

n°47030
AllenMadis​on
Oracle du Keb's
Posté le 31-08-2026 à 23:04:44  profilanswer
 

neo world a écrit :


Mac studio ultra  [:benzema_is_useless]

 

Medusa halo en 2027 pfft.

 

Ecoutez l'oracle et attendez un an les gars :o


Message édité par AllenMadison le 31-08-2026 à 23:07:18

---------------
Nothing much to teach, man. There's ze high, there's ze low and yall still fucking miss.
 Page :   1  2  3  4  5  ..  51  52  53  ..  56  57  58  59  60  61

Aller à :
Ajouter une réponse
 

Sujets relatifs
[Topic unique] IA générative de texte, ChatGPT, Copilot, Gemini & cosécurité de l'IA / agentique et des Devs en roue libre
Plus de sujets relatifs à : Infra IA : aide au choix et troubleshot de LLM Locaux


Copyright © 1997-2025 Groupe LDLC (Signaler un contenu illicite / Données personnelles)