Québec, Canada

403-1381 1re Avenue

+1 581.849.27.96

bdgouthiere@gmail.com

Un GPU cloud pour l'IA, sans vendre vos données ni un rein

Ou : pourquoi le prix de l’heure est la ligne la moins intéressante de votre future facture.

Une carte graphique qui vaut le prix d’une voiture neuve se loue aujourd’hui à la seconde, depuis un navigateur, pour à peu près le prix d’un café par heure d’utilisation. C’est la bonne nouvelle. La mauvaise, c’est que ce tarif affiché est la ligne la moins intéressante de la facture qui arrivera à la fin du mois. Choisir un fournisseur GPU cloud en 2026, c’est arbitrer entre des plateformes à la demande, des places de marché, des offres serverless et des API, avec des coûts de stockage, de réseau et de démarrage qui ne figurent jamais en gros caractères. Le calcul intensif est devenu un produit de consommation courante, vendu avec la notice d’un produit financier.

L’hébergement GPU, c’est la location de cartes graphiques installées dans un datacenter, payées au temps d’utilisation. L’IA en a besoin parce qu’un processeur graphique exécute des milliers d’opérations en parallèle, exactement ce que réclament l’entraînement d’un modèle et surtout l’inférence, le moment où un modèle déjà entraîné produit une réponse, une image ou une transcription. C’est cette charge de travail que vous paierez presque toujours. La performance d’une carte se juge d’abord à sa mémoire : 24 Go sur une RTX 4090, 48 Go sur une L40S, 80 Go sur une A100 ou une H100.

Il existe trois façons d’acheter ce calcul. Louer la machine : un pod ou une instance, facturé à l’heure, à la minute ou à la seconde, que la carte travaille ou non. Passer par le serverless : un worker qui démarre quand une requête arrive et s’éteint ensuite, facturé au temps de calcul réel, démarrage à froid compris. Ou appeler une API : vous ne voyez jamais le GPU, vous payez une image, une seconde de vidéo ou un million de tokens. Trois unités de prix impossibles à comparer directement, et trois façons de se tromper de calcul.

Louer la machine, payer l'appel, payer le résultat : trois robinets, trois compteurs, une seule facture à la fin.

Le prix à l’heure ne dit rien du reste : le stockage facturé même quand la machine dort, la sortie réseau, les quotas d’un compte neuf. C’est là que se jouent les écarts entre fournisseurs. Et la grille des tarifs ne pose jamais la question des données : quand vous envoyez un prompt ou un fichier client à un GPU loué, qui peut le lire, et sous quel droit ?

Ce guide part d’un usage réel. Les vidéos de ce site sont produites sur des GPU loués : clips image-to-video par WAN 2.2 et transcription par faster-whisper sur des workers serverless Runpod, illustrations de cette page par une API facturée 0,0035 dollar l’image. Les tarifs cités ont été relevés sur les grilles officielles le 27 septembre 2026.

Pour qui : un développeur, un créateur ou une petite équipe qui veut une H100, une L40S ou une RTX 4090 sans l’acheter, avec des modèles de pod prêts à lancer pour ComfyUI, PyTorch ou vLLM.

À partir de : 0,34 $ de l’heure pour une RTX 4090 en Community Cloud, 2,89 $ pour une H100 PCIe en Secure Cloud, facturés à la seconde, sans frais d’entrée ni de sortie de données.

Pour démarrer : ouvrir un compte Runpod, choisir la carte et le modèle de pod, et l’arrêter dès que le travail est fini.

Comparatif des fournisseurs GPU cloud : le prix à l’heure, la facture réelle, et où partent vos données

Sept lignes, quatre cartes. Les prix sont ceux d’une carte seule, à la demande, sans engagement : c’est ce qu’un compte neuf paie le premier jour. Les plateformes américaines affichent des dollars, les européennes des euros hors taxes. Vast.ai, qui est une place de marché, n’a pas de prix mais des offres : sa ligne donne la médiane des offres disponibles le jour du relevé, avec la moins chère entre parenthèses1.

FournisseurH100 80 GoA100 80 GoL40S 48 GoRTX 4090 24 Go
Runpod, Secure Cloud2,89 $ (PCIe), 3,49 $ (SXM)1,59 $1,09 $0,74 $
Runpod, Community Cloud1,99 $ (PCIe), 2,69 $ (SXM)1,19 $ (PCIe), 1,39 $ (SXM)0,79 $0,34 $
Vast.ai, médiane des offres3,02 $ en SXM (dès 1,87 $)0,80 $ (dès 0,43 $)0,80 $ (dès 0,52 $)0,51 $ (dès 0,20 $)
Lambda3,29 $ (PCIe), 4,29 $ (SXM)2,79 $, par grappe de huitnon proposéenon proposée
Modal, facturé à la seconde3,95 $2,50 $1,95 $non proposée
Scaleway2,87 € HT (PCIe)non proposée1,47 € HTnon proposée
OVHcloud2,80 € HT2,75 € HT1,40 € HTnon proposée

Trois choses sautent aux yeux, et aucune n’est le nom du moins cher. D’abord, la même RTX 4090 coûte 0,74 $ dans un datacenter du Secure Cloud de Runpod et 0,34 $ chez un hôte de son Community Cloud : une chambre d’hôtel contre une chambre chez l’habitant, où l’on dort aussi bien, mais sans gardien de nuit ni groupe électrogène. Ensuite, ni Scaleway ni OVHcloud ne louent de RTX 4090 : leur entrée de gamme pour générer des images est une L4 de 24 Go, à 0,79 € et 0,75 € de l’heure hors taxes. Enfin, au taux de change près, une H100 coûte à peu près la même chose chez OVHcloud et dans le Secure Cloud de Runpod. La différence est dans une colonne qu’on regarde rarement : celle de la société qui encaisse.

FournisseurModèleFacturationSortie réseauCrédit de départ
Runpodpods et serverless, société américaine, datacenters en Europe disponiblesà la secondegratuite5 $ de parrainage pour un compte européen, après un premier chargement de 10 $
Vast.aiplace de marché d’hôtes, offres interruptiblesà la secondefixée par chaque hôteaucun affiché
Lambdainstances et grappes, société américaineà la minutegratuiteaucun affiché
Modalserverless piloté en Python, société américaineà la secondenon détaillée sur la grille30 $ de calcul par mois avec l’offre Starter
Scalewayinstances à Paris et Varsovie, société françaiseà la minuteincluseaucun affiché
OVHcloudinstances, société françaiseà l’heure, toute heure entamée étant dueincluse200 € sur un premier projet Public Cloud

Lambda écrit dans sa documentation de facturation qu’elle ne facture ni l’entrée ni la sortie de données, Runpod dit la même chose de ses pods, et les deux européens incluent le trafic sortant. Les grands clouds généralistes, eux, facturent la sortie au gigaoctet au-delà d’un petit volume gratuit, une ligne qui peut peser autant que le calcul sur un projet qui exporte des vidéos. La granularité compte aussi : une heure entamée due pour un test de dix minutes, ce sont cinquante minutes payées pour rien.

Runpod GPU face à Vast.ai, Lambda et les clouds européens : les duels qui comptent

Un tableau compare des prix, un duel compare des usages. Vast.ai contre Runpod, c’est une place de marché où chaque hôte fixe son tarif contre une plateforme qui garantit un catalogue, un stockage réseau et une offre serverless. Lambda contre Runpod, c’est la grappe de huit H100 pour un laboratoire contre la carte seule à la seconde pour un développeur. Modal, fal.ai, Novita, Colab Pro, les hyperscalers : chacun gagne sur un terrain précis, reste à savoir lequel est le vôtre. Les confrontations une à une, avec un verdict par profil, sont rassemblées dans les duels entre fournisseurs GPU.

Ce que coûte vraiment une heure de GPU : spot, sortie réseau, crédits offerts

Un pod arrêté ne coûte plus de calcul, mais son volume continue de coûter : Runpod facture 0,20 $ par Go et par mois le disque d’un pod à l’arrêt, et 0,07 $ le Go de stockage réseau sous le téraoctet. Les offres interruptibles de Vast.ai coûtent plus de moitié moins que l’offre à la demande, contre le risque de voir la machine reprise en plein calcul. Les crédits gratuits existent, rares et conditionnés : 30 $ par mois chez Modal, 200 € sur un premier projet chez OVHcloud, quelques dollars de parrainage ailleurs. Estimer un budget, arbitrer entre louer et acheter une carte, repérer les frais absents de la grille : tout ça est détaillé dans le prix réel du GPU loué.

Le prix de l'heure est la plus petite partie du tas : stockage, sortie réseau et démarrages à froid font le reste.

Louer la machine ou payer chaque appel : serverless contre pod

Un pod, c’est une machine qu’on loue et qu’on oublie d’éteindre. Un worker serverless, c’est une machine qu’on ne loue que pendant qu’elle travaille, et qui met un moment à se réveiller. Sur le pipeline de ce site, un worker faster-whisper a mis 9,3 secondes à démarrer à froid pour 2,6 secondes de transcription effective : sur un appel isolé, le réveil coûte plus cher que le travail. Sur un flux continu, il disparaît. Le serverless coûte aussi plus cher à l’heure, 1,75 $ pour une L40S contre 1,09 $ en pod Secure Cloud chez Runpod, parce que la plateforme porte le risque de la machine inactive. Le choix dépend de la régularité de vos appels, et le calcul est posé dans serverless ou machine louée.

Générer des images sans payer l’image

Une API d’images facture à l’unité, un GPU loué à l’heure, et le seuil entre les deux arrive vite dès qu’on produit par lots. ComfyUI sur une RTX 4090 de 24 Go fait tourner Flux ou SDXL, un LoRA entraîné sur vos propres visuels et une chaîne de production scriptable. Restent trois questions : la VRAM de chaque modèle, ce que les licences autorisent pour un usage commercial, et le volume à partir duquel l’heure de GPU bat le prix unitaire. Ces arbitrages sont détaillés dans les images sur GPU loué.

Des clips vidéo depuis vos photos, avec des modèles ouverts

C’est la partie du pipeline de ce site qui a le plus coûté en patience. Un clip image-to-video de WAN 2.2 en 480 par 832 pixels, 41 images, a demandé 20 secondes de file d’attente et 202 secondes de calcul sur un worker serverless, pour 2,5 secondes de vidéo. En production, certains jobs sont restés neuf à dix minutes en file d’attente, ce qui a obligé à porter le délai d’abandon des scripts de dix à trente minutes. Rien de dramatique, à condition de ne promettre à personne une vidéo en temps réel. Le choix du modèle (WAN, HunyuanVideo ou LTX-Video), de la carte et le coût par seconde générée sont traités dans les clips IA depuis vos images.

Transcrire et synthétiser la voix sans abonnement à la minute

La transcription est le cas où l’auto-hébergement gagne le plus facilement : Whisper, publié en open source, tourne sur des cartes modestes, et faster-whisper l’accélère encore. Les voix de synthèse suivent le même chemin. En face, les API facturent à la minute, sans être forcément chères : Whisper V3 coûte 0,006 franc suisse la minute chez Infomaniak AI Services, soit 0,36 franc l’heure d’audio. Le seuil de rentabilité, la diarisation des locuteurs, les sous-titres et le cadre légal du clonage de voix sont dans la transcription et la voix sans abonnement.

Appeler un modèle image ou vidéo par API quand le GPU ne vaut pas la peine

Pour quelques dizaines d’images par semaine ou un prototype qui doit marcher demain, louer une carte n’a aucun sens. Une API de génération fait disparaître le GPU, le démarrage à froid et la maintenance du worker. WaveSpeed facture le modèle MiniMax Image-01 à 0,0035 $ l’image et WAN 2.2 en 480p à 0,15 $ le clip de cinq secondes, et les illustrations de ce guide sortent de là. fal.ai et Replicate appliquent le même principe avec d’autres catalogues et d’autres grilles. Le point de bascule entre l’API et le GPU serverless, et la façon de gérer les jobs longs par webhook, sont décrits dans l’API de génération média.

Une API LLM qui reste en Europe, et son prix au million de tokens

On peut aujourd’hui appeler Mistral, Qwen, Gemma ou Apertus, le modèle ouvert développé en Suisse, sans envoyer ses prompts aux États-Unis. Infomaniak AI Services en est l’exemple le plus simple : une API compatible OpenAI, des modèles hébergés dans ses datacenters suisses, des requêtes qui, selon l’hébergeur, ne sont ni stockées ni utilisées pour entraîner les modèles, et un million de crédits gratuits pour démarrer. Mistral Small 4 y coûte 0,20 franc suisse le million de tokens en entrée et 0,75 en sortie. OVHcloud et Scaleway proposent des services comparables. La grille complète, la migration depuis une API américaine sans réécrire le code et l’hébergement d’un modèle sur votre propre GPU se trouvent dans l’API LLM hébergée en Europe.

Où partent vos prompts, et qui a le droit de les lire

La localisation du serveur est la question qu’on pose, la nationalité de la société est celle qu’il faudrait poser : un GPU loué à Paris chez une entreprise américaine reste exploité par une société soumise au droit américain. Les conditions d’utilisation disent aussi si vos requêtes servent à entraîner les modèles et combien de temps elles sont gardées. Pour une PME qui envoie des données clients à une IA, le RGPD, l’AI Act et le contrat de sous-traitance comptent autant que la latence. Le trajet complet d’une requête et les clauses à lire avant de signer sont exposés dans le trajet de vos données.

Un prompt voyage. Reste à savoir qui tient les portes qu'il traverse.

L’assistant IA du quotidien, version européenne

Beaucoup n’ont besoin ni d’un GPU ni d’une API, juste d’un assistant conversationnel qui ne soit pas américain : Vibe de Mistral, l’ex-Le Chat, Euria d’Infomaniak, Lumo de Proton, ou un agrégateur comme Mammouth AI qui donne accès à plusieurs modèles pour un abonnement unique. Ils ne se valent pas, ni sur la qualité du français, ni sur l’hébergement des conversations, ni sur le prix. La comparaison, version gratuite comme version payante, est dans les assistants IA européens au quotidien.

Trois questions à se poser avant de louer

Quel GPU pour faire de l’IA ? Pour des images ou un petit modèle de langage, une RTX 4090 de 24 Go suffit le plus souvent. Pour la vidéo et les gros modèles, la mémoire décide : 48 Go sur une L40S, 80 Go sur une A100 ou une H100.

Où louer un serveur d’IA ? Chez un loueur spécialisé (Runpod, Vast.ai, Lambda, Modal) pour le prix et le catalogue, chez un hébergeur européen (OVHcloud, Scaleway, Infomaniak) pour le droit applicable et la facture en euros.

Combien coûte la location d’un GPU ? De 0,20 $ de l’heure pour une RTX 4090 chez l’hôte le moins cher de Vast.ai à 4,29 $ pour une H100 SXM seule chez Lambda, le 27 septembre 2026. Le chiffre qui compte reste celui du mois, stockage et démarrages compris.

Alors, quel GPU, quelle API, et pour qui ?

Si vous voulez une machine, que ce soit une RTX 4090 pour ComfyUI ou une H100 pour servir un modèle, et payer à la seconde sans frais de sortie, Runpod est le point de départ le plus simple : le même compte pour les pods et le serverless, des datacenters européens dans le Secure Cloud, et un Community Cloud pour les budgets serrés. C’est là que tourne le pipeline vidéo de ce site.

Si vous voulez une image, une voix ou un clip sans jamais voir de GPU, WaveSpeed fait le travail à l’unité, à des prix qui rendent l’auto-hébergement inutile tant que vos volumes restent modestes.

Et si vos prompts contiennent des données clients, un dossier médical ou un contrat, Infomaniak AI Services règle la question que les deux autres laissent ouverte : un LLM ouvert, hébergé en Suisse, dont les requêtes, selon l’hébergeur, ne servent pas à l’entraînement. Le calcul se loue partout. La confiance, elle, se choisit.


  1. Relevé du 27 septembre 2026 sur l’API publique de Vast.ai : offres à une seule carte, à la demande, disponibles à la location. La médiane porte sur 11 offres pour la H100 SXM, 20 pour l’A100 SXM de 80 Go, 9 pour la L40S et 64 pour la RTX 4090. Certaines RTX 4090 y affichent 48 Go de mémoire : ce sont des cartes modifiées, ce qui en dit long sur l’inventivité d’une place de marché. ↩︎