Québec, Canada

403-1381 1re Avenue

+1 581.849.27.96

bdgouthiere@gmail.com

Serverless GPU ou pod à l'heure : le choix qui fait la facture

Ou : louer la voiture à la journée ou prendre le taxi à la course, pour une carte graphique qui coûte le prix d’une voiture.

Une carte graphique se loue de deux façons, et la différence compte plus que le prix affiché. Le pod est une machine entière, facturée à la seconde tant qu’elle tourne, que la carte calcule ou non : une RTX 4090 y coûte 0,34 $ de l’heure en Community Cloud chez Runpod. Le serverless ne démarre la carte que lorsqu’une requête arrive, et l’arrête quelques secondes après : la même RTX 4090 y coûte 1,10 $ de l’heure, mais seulement pendant le calcul, le chargement du modèle et un bref délai d’inactivité. Le guide pour choisir son fournisseur GPU cloud compare les prix entre plateformes ; cette section s’occupe du choix qui vient juste après, et qui fait souvent varier la facture du simple au triple.

La règle générale tient en une phrase : le pod gagne quand la carte travaille la plupart du temps où la machine est allumée, le serverless quand le travail arrive par à-coups. Entre les deux, tout dépend de détails que les grilles tarifaires ne montrent pas : le temps de réveil d’un worker, l’endroit où dorment les modèles, le nombre de workers autorisés, la façon d’attendre un job de plusieurs minutes. La documentation serverless de Runpod les décrit un par un, et chacun a sa page dans cette section.

Cette section a aussi un avantage rare : un vrai retour d’expérience. Le site fait tourner quatre endpoints serverless depuis mars 2026, pour la transcription, les images et la vidéo, et leur facture est lue ligne par ligne dans l’historique du compte : 13,74 $ au total, dont 8,43 $ pour produire une vidéo de six minutes. Les chiffres de cette section viennent de là quand ils ne viennent pas de la documentation officielle.

Pour qui : un développeur ou un créateur qui hésite entre louer une machine GPU à l’heure et payer la carte à la seconde, à la requête.

À partir de : 0,34 $ de l’heure pour une RTX 4090 en pod Community Cloud ; 0,00031 $ la seconde, soit 1,10 $ de l’heure, pour la même carte en serverless, rien quand elle ne tourne pas.

Pour démarrer : ouvrir un compte Runpod, lancer un pod pour explorer, puis déployer un worker serverless quand le traitement est prêt à tourner sans vous.

La machine qu'on loue et celle qu'on appelle : même carte, deux factures qui n'ont rien à voir.

GPU serverless : ce que vous payez à la seconde et ce que vous attendez au démarrage

Dix questions se posent avant de choisir, et chacune a sa page, avec les chiffres relevés le 27 septembre 2026.

Le fonctionnement, et ce qui est vraiment facturé

Un endpoint, une file d’attente, un scaler et des workers : le mécanisme est simple, la facture un peu moins, parce que le chargement du modèle et les cinq secondes d’inactivité se paient aussi. Le détail, carte par carte, est dans comment marche un GPU serverless.

Le moment où la machine louée gagne

Une RTX 4090 en pod devient moins chère qu’en serverless dès que la carte travaille 31 % du temps en Community Cloud, 67 % en Secure Cloud. Les autres cartes et les usages qui imposent le pod sont dans quand louer le pod plutôt que le worker.

Le réveil d’un worker

Un worker faster-whisper a mis 9,3 secondes à démarrer pour 2,6 secondes de travail. Modèle en cache, modèle intégré à l’image, FlashBoot, workers actifs : les leviers sont classés dans réduire le cold start d’un worker.

Son propre worker avec Docker

Un fichier Python, un Dockerfile, un test en local et un déploiement depuis un registre ou GitHub. La marche à suivre, image ComfyUI personnalisée comprise, est dans un worker Docker pas à pas.

L’endroit où dorment les modèles

Quarante gigaoctets de modèles coûtent 2,80 $ par mois sur un volume réseau, 8 $ sur le disque d’un pod arrêté. Les contraintes de chaque option, dont celle du centre de données, sont dans les volumes réseau pour vos modèles.

Les jobs de plusieurs minutes

Dix minutes de calcul au plus par défaut, trente minutes de conservation du résultat, trois tentatives de webhook : ces délais décident si un job long arrive à bon port. Tout est dans les jobs asynchrones et webhooks.

Le nombre de workers

Le nombre de workers change l’attente bien plus que la facture : un pic de soixante requêtes par minute sur trois workers laisse plus de deux mille requêtes en file au bout d’une heure. Le calcul est dans l’autoscaling et la concurrence.

Une production vidéo, facture à l’appui

84 clips WAN 2.2 sur RTX 4090 et 5090 pour 6,54 $, 84 images de départ pour 1,84 $, et une leçon : la facture compte un tiers de temps de plus que le chronomètre. Le détail est dans le retour d’expérience chiffré.

La carte à louer

24 Go pour une RTX 4090, 48 pour une L40S, 80 pour une A100 ou une H100 : la mémoire décide de ce qui tourne, le prix de ce qui est raisonnable. Le choix, usage par usage, est dans quelle carte GPU louer.

Le premier pod

Un compte, 10 $ de premier chargement, un modèle de départ, une connexion SSH, et surtout la suppression de la machine à la fin : arrêté, le pod garde un disque facturé 10 $ par mois. Les étapes sont dans ouvrir un compte et lancer un pod.

Sur le même sujet