Québec, Canada

403-1381 1re Avenue

+1 581.849.27.96

bdgouthiere@gmail.com

Choisir sa carte GPU en cloud : VRAM, prix à l'heure et usage

Ou : pourquoi la carte la plus chère n’est presque jamais la bonne, et la moins chère presque jamais non plus.

La réponse courte : la mémoire de la carte décide de ce qui peut tourner, la bande passante de la vitesse à laquelle un modèle de langage répond, et le format FP8 du reste. Une RTX 4090 de 24 Go, à 0,34 $ de l’heure en Community Cloud chez Runpod, suffit pour Flux en FP8, Whisper, un LLM de 7 à 13 milliards de paramètres ou l’entraînement d’un LoRA. Une L40S de 48 Go, à 0,79 $, ouvre les modèles de 24 à 32 milliards quantifiés. Il faut 80 Go, une A100 ou une H100, pour un modèle de 70 milliards en 4 bits. Au-delà, H200 et B200. C’est la décision qui précède toutes les autres dans pods et workers GPU, parce qu’une carte trop petite ne fonctionne pas du tout, et qu’une carte trop grande coûte trois fois le nécessaire.

La mémoire d’abord, parce qu’elle ne se négocie pas. Un modèle qui ne tient pas en VRAM ne tourne pas, ou tourne en déchargeant une partie sur la mémoire centrale, ce qui le rend beaucoup plus lent. Pour un modèle de langage, la règle de Hugging Face est simple : environ 2 Go par milliard de paramètres en 16 bits, deux fois moins en 8 bits, quatre fois moins en 4 bits, plus le cache des tokens qui grandit avec la longueur du contexte. Llama 3.1 8B demande 16 Go en 16 bits, le 70B 140 Go, ou 35 Go en 4 bits.

Le format de calcul ensuite, un critère que les comparatifs de prix oublient. Les cartes des générations Ada (RTX 4090, L4, L40S) et Hopper (H100, H200) calculent nativement en FP8, ce qui divise la mémoire par deux par rapport au 16 bits pour une perte de qualité faible. Les cartes Ampere (A100, A40, RTX A6000) ne le font pas. Les Blackwell (RTX 5090, B200) ajoutent le FP4. Une A100 de 80 Go moins chère à l’heure qu’une H100 perd donc une partie de son avantage dès que le modèle existe en FP8.

Pour qui : un développeur ou un créateur qui veut louer la carte juste suffisante pour son modèle, sans payer la mémoire ni la puissance dont il ne se servira pas.

À partir de : 0,34 $ de l’heure pour une RTX 4090 de 24 Go en Community Cloud, 0,79 $ pour une L40S de 48 Go, 1,19 $ pour une A100 de 80 Go, facturés à la seconde.

Pour démarrer : ouvrir un compte Runpod, lancer un pod sur la plus petite carte qui tient le modèle, et mesurer avant de monter en gamme.

Quel GPU louer pour l’IA : mémoire, vitesse et prix chez Runpod

CarteMémoireBande passanteFP8Pod CommunityPod SecureUsage type
RTX 409024 Go1 008 Go/soui0,34 $0,74 $Flux en FP8, LLM 7 à 13B, Whisper, LoRA Flux
RTX 509032 Go1 792 Go/soui, et FP40,69 $0,99 $la même chose, avec de la marge
A4048 Go696 Go/snon0,35 $0,49 $48 Go à bas prix, sans FP8
L40S48 Go864 Go/soui0,79 $1,09 $LLM de 24 à 32B quantifiés, vidéo
A100 PCIe80 Go1 935 Go/snon1,19 $1,59 $LLM 70B en 4 bits, entraînement
H100 SXM80 Go3 350 Go/soui2,69 $3,49 $débit des LLM, entraînement en FP8
H200141 Go4 800 Go/soui3,59 $4,59 $un 70B en FP8 sur une seule carte
B200180 Go7 700 Go/soui, et FP45,98 $6,79 $très grands modèles

Prix des pods à l’heure relevés le 27 septembre 2026, caractéristiques tirées des fiches NVIDIA.

Les besoins réels, usage par usage, confirment la hiérarchie. En image, Flux dev pèse 23,8 Go de poids en 16 bits, et NVIDIA estime qu’il ne tient alors que sur une RTX 4090 ou une carte professionnelle ; en FP8, le transformeur tombe à 12 Go et la carte de 24 Go devient confortable. En vidéo, le dépôt officiel de WAN 2.2 annonce 80 Go pour son modèle de 14 milliards de paramètres actifs, mais les workflows ComfyUI en FP8 le font tourner sur 24 Go : le pipeline vidéo de ce site a produit 84 clips sur RTX 4090 et RTX 5090. En audio, faster-whisper tient en 4,5 Go avec le modèle large-v2 en 16 bits, selon son dépôt. Pour l’entraînement d’un LoRA Flux, les outils courants visent 24 Go, et descendent plus bas au prix d’une bonne dose de patience.

Pour les modèles de langage, la mémoire ne suffit pas, parce que la génération de texte est limitée par la bande passante. Chaque token produit oblige à relire tous les poids : BentoML calcule ainsi qu’avec la bande passante d’une H100 SXM, un modèle de 70 milliards en 16 bits ne dépasse pas 24 tokens par seconde environ. C’est la vraie raison d’être des H100 et des H200 : pas la mémoire, que l’A100 offre aussi, mais une bande passante 1,7 à 2,5 fois plus élevée. La page de Runpod sur le choix des pods donne d’ailleurs sa propre grille : 24 Go pour un LLM de 7 à 13 milliards, 48 à 80 Go de 30 à 70 milliards, 40 à 80 Go pour l’entraînement, 16 à 24 Go pour SDXL et Flux.

Ma méthode tient en trois étapes. Calculer la mémoire du modèle au format visé, en ajoutant 10 à 30 % pour le cache et les activations, comme le conseille BentoML. Prendre la plus petite carte qui la contient, en préférant une carte FP8 quand le modèle existe dans ce format. Puis mesurer une heure de travail réel avant de monter en gamme : une carte deux fois plus chère n’est rentable que si elle va plus de deux fois plus vite sur votre charge.

Le modèle doit tenir dans le réservoir : ce qui déborde ne tourne pas, ce qui reste vide se paie quand même.

Si vous hésitez entre pod et serverless

La carte choisie se loue à l’heure ou à la seconde de calcul. Le taux d’occupation à partir duquel la machine devient moins chère est calculé dans le pod face au serverless.

Si vous voulez essayer la carte tout de suite

Un premier pod se lance en quelques minutes, à condition de préparer sa clé SSH et de savoir l’arrêter. La marche à suivre est dans votre premier pod GPU.

Si vos modèles pèsent plus lourd que la carte

Les poids doivent aussi être stockés quelque part entre deux sessions. Le prix de 40 Go de modèles, selon l’endroit où ils dorment, est dans où ranger ses modèles.