Louer un pod GPU : les cas où la machine bat le serverless
Ou : pourquoi la chambre d’hôtel devient moins chère que le taxi dès qu’on y dort plus de quelques heures.
La réponse courte : un pod GPU loué à l’heure coûte moins cher qu’un worker serverless dès que la carte travaille plus de la moitié du temps où la machine est allumée, et même dès un tiers du temps en Community Cloud. Chez Runpod, une RTX 4090 coûte 0,74 $ de l’heure en pod Secure Cloud et 0,34 $ en Community Cloud, contre 1,10 $ en serverless. Au-delà du prix, le pod s’impose pour tout ce qui est interactif : une session ComfyUI, un carnet Jupyter, un entraînement qu’on surveille, une connexion SSH pour déboguer. Le serverless garde l’avantage pour les appels irréguliers d’une application. C’est la moitié du choix entre serverless ou machine louée, et c’est la moitié la plus simple à calculer.
La différence de modèle tient en une phrase. Un pod est une machine avec une carte graphique, facturée à la seconde du démarrage à l’arrêt, que la carte calcule ou non. Un worker serverless ne tourne que lorsqu’une requête arrive, et s’arrête quelques secondes après la dernière, mais sa seconde coûte plus cher. La grille de Runpod le montre carte par carte : le serverless coûte entre 1,5 et 3,2 fois le prix du pod, selon la carte et la gamme.
Il reste donc une seule question, le taux d’occupation. Si vous gardez un pod allumé huit heures et que la carte ne calcule que deux heures, vous payez huit heures. Le même travail en serverless coûte deux heures au tarif serverless, plus les démarrages à froid. Le seuil de rentabilité est le rapport entre les deux prix.
Pour qui : un développeur ou un créateur qui travaille en session, carnet Jupyter, ComfyUI, entraînement, et garde la carte occupée la plupart du temps où la machine tourne.
À partir de : 0,34 $ de l’heure pour une RTX 4090 en Community Cloud, 0,74 $ en Secure Cloud, 1,09 $ pour une L40S en Secure Cloud, facturés à la seconde.
Pour démarrer : ouvrir un compte Runpod, lancer un pod sur la carte voulue, et l’arrêter dès la fin de la session.
Pod GPU ou serverless : le taux d’occupation qui fait basculer la facture
| Carte | Pod Secure Cloud | Pod Community Cloud | Serverless (flex) | Le pod gagne au-delà de |
|---|---|---|---|---|
| RTX 4090 24 Go | 0,74 $ | 0,34 $ | 1,10 $ | 67 % d’occupation en Secure, 31 % en Community |
| L40S 48 Go | 1,09 $ | 0,79 $ | 1,75 $ | 62 % en Secure, 45 % en Community |
| A100 80 Go | 1,59 $ (PCIe) | 1,19 $ (PCIe) | 2,72 $ | 58 % en Secure, 44 % en Community |
| H100 80 Go | 2,89 $ (PCIe) | 1,99 $ (PCIe) | 4,79 $ | 60 % en Secure, 42 % en Community |
Tous les prix sont à l’heure, relevés le 27 septembre 2026. Le seuil est un minimum : il ignore les démarrages à froid du serverless, qui déplacent encore la balance vers le pod quand les requêtes sont espacées, et il ignore le temps pendant lequel on oublie d’arrêter le pod, qui la déplace dans l’autre sens.
Les chiffres donnent la règle, les usages donnent les exceptions. Le pod s’impose, quel que soit le calcul, dans quatre situations. Une session interactive d’abord : l’interface de ComfyUI, un carnet Jupyter ou un terminal ne se prêtent pas à un worker qui s’éteint cinq secondes après la dernière requête. Un entraînement ensuite, qu’on veut suivre, interrompre, reprendre, avec des fichiers qui restent sur le disque entre deux essais. Le débogage, où l’on veut une connexion SSH et une machine qui ne disparaît pas. Enfin, un service qui tourne en continu : si la carte calcule vingt heures sur vingt-quatre, le serverless revient à payer une machine allumée au prix fort.
Le serverless garde l’avantage dans les cas inverses : une application dont les requêtes arrivent de façon irrégulière, un pic de quelques heures par semaine, un traitement par lots qui démarre sans qu’on soit là. C’est le choix que j’ai fait pour le pipeline vidéo de ce site : 84 clips produits en deux journées, par un script qui soumet et récupère, sans jamais ouvrir de terminal sur la machine.
Un dernier critère, rarement mentionné : la disponibilité. Un pod réserve une carte tant qu’il tourne, et la documentation de Runpod prévient qu’un pod arrêté peut redémarrer sans carte, si quelqu’un l’a louée entre-temps. Un endpoint serverless, lui, peut accepter plusieurs types de cartes par ordre de préférence et prend celle qui est libre. Pour une carte très demandée, cette souplesse vaut parfois plus que la différence de prix.
Si vous louez votre premier pod
Ouvrir le compte, choisir le modèle de départ, se connecter en SSH et ne pas oublier d’arrêter la machine : la marche à suivre est dans louer son premier GPU.
Si vous hésitez sur la carte
Une RTX 4090 à 0,34 $ ou une H100 à 1,99 $ de l’heure ne font pas le même travail. La VRAM et le prix de chaque carte, selon l’usage, sont comparés dans quelle carte louer pour l’IA.
Si vous restez finalement sur le serverless
Le calcul change si le worker se réveille vite. Ce qui fait passer un démarrage de quarante secondes à trois est détaillé dans raccourcir le réveil d’un worker.