Ce que vous payez pendant que le worker se réveille
Ou : le serverless ne coûte rien pendant qu’il dort, mais personne n’a dit qu’il se réveillait gratuitement.
La réponse courte : oui, le démarrage à froid se paie. Chez Runpod, un worker serverless est facturé de son démarrage jusqu’à son arrêt complet, arrondi à la seconde supérieure : temps de démarrage, exécution, puis cinq secondes d’inactivité par défaut. Chez Modal, le chargement de l’application est facturé, et le conteneur reste allumé, et facturé, 60 secondes après le dernier appel. Sur un appel isolé, ce réveil coûte souvent plus cher que le travail lui-même. C’est le coût le plus sous-estimé de la facture GPU, parce qu’il n’apparaît dans aucune grille.
La grille serverless de Runpod décrit les trois phases facturées. Un endpoint neuf démarre avec trois workers au maximum, cinq secondes d’inactivité avant l’arrêt, un délai d’exécution de 600 secondes et la fonction FlashBoot activée, qui promet des démarrages sous les 200 millisecondes pour un worker récemment actif. Le nombre total de workers dépend du solde du compte : cinq par défaut, dix à partir de 100 $ chargés, jusqu’à soixante au-delà de 900 $.
Pour qui : une application qui appelle un modèle de façon irrégulière et veut payer zéro quand personne ne s’en sert.
À partir de : 1,10 $ de l’heure pour un worker RTX 4090 en serverless, soit 0,00031 $ la seconde, 1,75 $ pour une L40S, facturés à la seconde de worker actif.
Pour démarrer : ouvrir un compte Runpod, déployer un worker serverless, et régler l’inactivité et le nombre de workers selon le rythme réel des appels.
Cold start serverless GPU : le calcul sur un appel isolé
Sur le pipeline de ce site, un worker faster-whisper a mis 9,3 secondes à démarrer à froid, puis 2,6 secondes à transcrire un extrait de cinq secondes. Ajoutez les cinq secondes d’inactivité par défaut : le worker a été facturé environ 17 secondes pour 2,6 secondes de travail utile. Sur une RTX 4090 en serverless, c’est environ 0,0052 $ l’appel, dont 85 % pour le réveil et l’attente. Le même appel sur un worker déjà chaud, au milieu d’un flux continu, ne coûte que ses 2,6 secondes, soit 0,0008 $.
| Scénario | Secondes facturées | Coût sur RTX 4090 serverless |
|---|---|---|
| Appel isolé, démarrage à froid | environ 17 s | environ 0,0052 $ |
| Appel dans un flux continu, worker chaud | environ 2,6 s | environ 0,0008 $ |
| 1 000 appels isolés par jour | environ 4,7 heures | environ 5,24 $ par jour |
| 1 000 appels regroupés en flux continu | environ 43 minutes | environ 0,80 $ par jour |
Il existe trois façons de réduire l’écart. Garder un worker actif en permanence supprime le réveil mais facture chaque seconde, avec une remise négociée auprès du commercial de Runpod. Allonger le délai d’inactivité garde le worker chaud entre deux appels rapprochés, contre quelques secondes payées à attendre. Et surtout, réduire le temps de démarrage lui-même : un modèle déjà présent dans l’image ou sur un volume réseau démarre bien plus vite qu’un modèle retéléchargé à chaque réveil. Chez Modal, le même arbitrage se règle avec un délai de maintien ajustable de 2 secondes à 20 minutes, selon sa documentation.
Un dernier réglage par défaut surprend souvent : un endpoint qui ne reçoit plus aucune requête se réduit tout seul. Selon la documentation de Runpod, il descend à deux workers au maximum après trois jours d’inactivité, puis à zéro après sept jours. Le premier appel qui suit une longue pause subit donc un démarrage à froid complet, quel que soit le réglage initial.
Si le serverless ne vous convient plus
Au-delà d’un certain volume d’appels réguliers, un pod allumé en continu devient moins cher que le serverless. Le prix de l’heure de chaque carte est détaillé dans payer le GPU à la seconde.
Si c’est la vitesse du modèle qui coûte
Une fois le worker réveillé, chaque requête peut encore coûter moins, en regroupant les appels ou en changeant de précision. Les techniques sont décrites dans optimiser le débit du GPU.
Si vous voulez l’intégrer à un budget
Le coût du démarrage à froid se range dans la première ligne d’un budget GPU, celle des heures facturées. La méthode complète est dans le budget d’un projet IA en trois lignes.