Ce que m'a coûté un pipeline vidéo complet sur GPU serverless
Ou : six minutes de vidéo, sept heures de carte graphique, et une facture qui tient sur un ticket de caisse.
La réponse courte : la vidéo sur kDrive publiée avec ce site, un peu plus de six minutes de montage, a coûté 8,43 $ de GPU serverless chez Runpod. Dans le détail : 6,54 $ pour 84 clips WAN 2.2 sur RTX 4090 et RTX 5090, 1,84 $ pour 84 images de départ sur A40, 0,05 $ pour la transcription. Les voix et la musique ont tourné gratuitement sur Colab. Le chiffre qui compte est ailleurs : chaque clip conservé a coûté 0,078 $, deux fois moins que le même modèle acheté à l’unité, mais la facture compte quatre minutes de carte par clip là où le chronomètre en mesurait trois. C’est le cas concret de toute l’architecture serverless sur GPU : payer à la seconde, oui, mais toutes les secondes.
Les chiffres de cette page ne sont pas des estimations. Ils viennent de l’historique de facturation de mon compte, lu par l’API de Runpod le 27 septembre 2026, jour par jour et carte par carte, pour les deux journées de production des images et des clips, le 30 avril et le 1er mai 2026, et pour la transcription du 27 avril. La configuration des quatre endpoints a été relue de la même façon.
L’architecture tient en peu de choses. Quatre endpoints serverless, tous réglés à zéro worker minimum, cinq secondes d’inactivité avant l’arrêt et FlashBoot activé : un worker ComfyUI pour les images de départ, autorisé sur dix types de cartes et qui a tourné sur A40 ; un worker WAN 2.2 image vers vidéo, publié par un tiers sur GitHub, limité à trois workers sur RTX 4090 ou RTX 5090 ; un worker faster-whisper sur RTX 4090 pour les sous-titres. Un script Python par scène envoie l’image source en base64 sur la route asynchrone, interroge le statut toutes les quinze secondes et décode la vidéo reçue. Le montage final se fait en local.
Pour qui : un créateur ou un développeur qui produit des clips et des images par lots, et veut payer la carte graphique à la seconde, zéro quand rien ne tourne.
À partir de : 0,00031 $ la seconde de RTX 4090 en serverless, soit 1,10 $ de l’heure, 0,00044 $ pour une RTX 5090, 0,00034 $ pour une A40.
Pour démarrer : ouvrir un compte Runpod, déployer un worker serverless WAN 2.2 ou ComfyUI, et régler le nombre de workers sur le rythme réel de la production.
Pipeline vidéo sur GPU serverless : la facture réelle, étape par étape
| Étape | Modèle et réglages | Carte | Secondes facturées | Coût | Par unité conservée |
|---|---|---|---|---|---|
| 84 images de scène | modèle d’image ouvert via ComfyUI | A40 48 Go | 5 424 s | 1,84 $ | 0,022 $ l’image |
| 84 clips de 5 s | WAN 2.2 image vers vidéo, 832 x 480, 81 images, 10 étapes | RTX 4090 (91 % du temps), RTX 5090 | 20 131 s | 6,54 $ | 0,078 $ le clip |
| Transcription de 16 voix | faster-whisper | RTX 4090 | 169 s | 0,05 $ | 0,003 $ la voix |
| Voix et musique | Qwen3-TTS et ACE-Step | Colab gratuit | non facturé | 0 $ | 0 $ |
| Total | 25 724 s, soit 7 h 09 | 8,43 $ |
Première leçon : la facture ne ressemble pas au chronomètre. Au test, un clip WAN 2.2 demandait environ trois minutes de calcul. La facture de production compte 240 secondes par clip conservé. L’écart, un tiers de plus, vient de trois sources que l’historique ne distingue pas : les clips refaits, les démarrages à froid d’un worker qui recharge un modèle vidéo volumineux, et les cinq secondes d’inactivité facturées après chaque job. Pour budgéter une production serverless, prenez le temps mesuré et ajoutez un tiers.
Deuxième leçon : les clips étaient une bonne affaire, les images une mauvaise. Un clip WAN 2.2 en 480p coûte 0,15 $ chez WaveSpeed ; le mien a coûté 0,078 $, à dix étapes au lieu de quarante et sur des cartes grand public. La version accélérée de WaveSpeed, à 0,05 $, reste cependant moins chère, sans rien à construire. Les images, elles, ont coûté 0,022 $ pièce, soit 64 secondes d’A40 par image conservée. L’historique ne dit pas quelle part revient aux images refaites, aux réveils du worker ComfyUI ou à l’A40, plus lente qu’une RTX 4090. Le résultat, lui, est clair : six fois le prix d’une image MiniMax Image-01 par API. Depuis le 18 septembre 2026, les illustrations du site passent par cette API, à 0,0035 $ l’image.
Troisième leçon : la file d’attente est un paramètre du budget de temps, pas du budget d’argent. Certains jours, un clip attendait neuf à dix minutes avant d’être lancé, sans que l’historique permette de dire si le plafond de trois workers ou la disponibilité des cartes était en cause. Cette attente n’est pas facturée, mais elle faisait échouer la boucle du script, réglée à dix minutes : des clips finissaient, payés, sans être récupérés. Le délai est passé à trente minutes, et les clips orphelins se récupèrent par leur identifiant tant que Runpod garde le résultat, trente minutes après la fin du job selon sa documentation des requêtes.
Pour situer l’ensemble, tout l’usage serverless du site depuis mars 2026, tests et essais ratés compris, tient en 13,74 $. Le poste le plus cher n’est pas la carte graphique : c’est le temps passé à construire, régler et surveiller les workers, qu’aucune facture ne mentionne.
Si vos workers mettent trop longtemps à se réveiller
Une partie des 64 secondes par image se perd dans les réveils du worker. Les réglages qui les réduisent, du modèle intégré à l’image aux workers actifs, sont détaillés dans réduire le démarrage à froid.
Si la file d’attente vous freine
Une file de neuf minutes peut venir d’un plafond de workers trop bas comme d’une carte indisponible. Combien de workers lancer, et ce que coûte un pic de production, se calcule dans le nombre de workers GPU.
Si vous construisez la même boucle d’attente
Soumission asynchrone, polling, délai maximal et récupération d’un job orphelin : la mécanique complète est dans les jobs asynchrones sur GPU serverless.