| Mevo |
ionik a écrit :
Oui j'imagine, mais je ne pense pas que le cout soit meilleur non plus a l'héberger sauf a avoir un usage H24 qui justifierais le cout supplémentaire.
Tiens pour mon information faudrait que je regarde combien ça coute l'hébergement de model par rapport a la taille en GB (doit bien avoir des provider qui font ça en fonction de la taille du model et du contexte)
|
Tu n'es pas forcément obligé de faire du H24, les GPUs peuvent se louer facilement à l'heure (et tu payes très peu, voire quasi rien, lorsque tu n'utilises pas. Ensuite, tu bootes le truc dès que t'as besoin, tu lances un gros batch, et tu ré-arrêtes - c'est même automatique)
Ca ne se vend pas "au Go", mais par GPU, donc tu ne peux pas ajuster exactement comme tu veux, il faut prendre ce qui colle à peu près pour que tu aies au moins assez + ce qu'il faut pour le contexte, tout en essayant que ce soit le moins possible (pour les $$$ :o ). En plus, ce qui est chiant est que tu ne peux généralement avoir qu'un nombre pair de GPUs. Si tu pouvais en avoir 3, ca t'arrangerait bien pour utiliser du GLM 5.3 Flash quantifié en Q4 (c'est un peu moins performant, mais ca marche tout de même bien). Ca ferait 200 Go tout rond pour du Q4 XL, mais 3 GPU, c'est pas trop possible.
Tu peux regarder chez AWS, ou il y a un tas de providers qui proposent ca. (Lambda, Vast, etc.)
Disons que si t'es quand même un peu radin comme moi ( :o ), et que tu te contentes d'une quantification en 6 bits (là, t'es bien, en rapport taille/perf). GLM 5.3 Flash Q6 XL, c'est 292 Go.
4 GPUs de 80 Go te fera 320 Go, ca devrait être chouette. De l'A100, qui est dans le "pas trop cher", mais tout de même performant, et ca a 80 Go, ca coute par exemple $2.5 de l'heure chez AWS. Donc $10 l'heure pour 4. T'as 720 ou 750 heures par mois (30 ou 31 jours) si tu veux tourner en continu (soit $7200 à $7500 par mois). EDIT: En fait, c'est 744 heures pour un mois de 31 jours, mais 750 est souvent utilisé pour tout calculer facilement :o
Tu dois pouoir trouver assez facilement moins cher que AWS, surtout si t'es flexible (certains providers font de super tarifs si tu acceptes de te faire éjecter dès qu'ils ont un besoin. Tu loues ce qui est inutilisé et t'acceptes de lâcher à n'importe quel moment en échange d'un bon prix).
Vast annonce de la H100 (une version supérieure à la A100, aussi avec 80 Go) mentionée par LibreArbitre à $2 de moyenne en ce moment et à partir de $1.33. Ca te donne à peu près les chiffres pour faire tes calculs (donc x4 et c'est par heure). |