# Payer la génération ou payer la seconde de GPU : le seuil

> Flux dev et WAN 2.2 : prix à l'unité chez WaveSpeed face au coût d'un worker Runpod Serverless à la seconde, et le volume où louer le GPU devient rentable.


*Ou : le taxi, la voiture de location, et le moment précis où l'on ferait mieux de prendre le volant.*

La réponse courte : pour l'image, un worker serverless devient moins cher qu'une API dès que vous générez par lots, mais l'écart se compte en fractions de centime et ne paie pas le temps passé à construire le worker. Pour la vidéo en qualité complète, l'API gagne à tous les volumes : un clip WAN 2.2 de cinq secondes en 480p coûte 0,15 $ chez WaveSpeed, et environ 0,44 $ de calcul sur une H100 louée à la seconde. Le calcul ne bascule qu'avec un modèle accéléré, et encore, de peu. C'est la question que toute [API de génération média](/guides/gpu-cloud-ia/api-inference-media/) finit par poser à ses clients les plus réguliers.

Le principe est le même que pour une course en taxi. L'API facture le résultat, quel que soit le temps que sa machine y a passé : 0,012 $ l'image Flux dev, 0,15 $ le clip WAN 2.2 en 480p. Le serverless facture la seconde de carte graphique, du démarrage du worker à son arrêt : 0,00031 $ la seconde pour une RTX 4090 chez Runpod, 0,00133 $ pour une H100, selon [la grille serverless de Runpod](https://www.runpod.io/pricing). Pour comparer, il faut donc connaître le temps de calcul d'une génération, et c'est là que tout se joue.

Pour Flux dev en 1024 pixels, les mesures publiées donnent une dizaine de secondes sur une RTX 4090 en 20 étapes avec FP8, et entre 3 et 7 secondes sur une H100 en 28 étapes selon les optimisations. Pour WAN 2.2 image vers vidéo, [le tableau officiel du dépôt Wan2.2](https://github.com/Wan-Video/Wan2.2) mesure 328 secondes sur une H100 pour un clip 480p de 81 images en 40 étapes, et 1 056 secondes en 720p. Ces deux ordres de grandeur suffisent à trancher la plupart des cas.

> **Pour qui** : un développeur qui génère déjà régulièrement et se demande s'il est temps de faire tourner le modèle lui-même.
>
> **À partir de** : 0,012 $ l'image Flux dev et 0,15 $ le clip WAN 2.2 de cinq secondes chez WaveSpeed ; 0,00031 $ la seconde de RTX 4090 et 0,00133 $ la seconde de H100 en Runpod Serverless.
>
> **Pour démarrer** : rester sur WaveSpeed tant que le volume est irrégulier ; déployer un worker sur Runpod Serverless quand les générations arrivent par lots de centaines.

## API ou GPU serverless : le calcul, génération par génération

| Charge de travail | API WaveSpeed | Worker Runpod Serverless | Gagnant |
|---|---|---|---|
| Une image Flux dev, worker déjà chaud | 0,012 $ | environ 0,003 $ sur RTX 4090 (10 s) | serverless |
| 1 000 images Flux dev en un lot | 12 $ | environ 3 à 5 $ sur RTX 4090 | serverless |
| Un clip WAN 2.2 480p, 40 étapes | 0,15 $ | environ 0,44 $ sur H100 (328 s) | API |
| Un clip WAN 2.2 720p, 40 étapes | 0,30 $ | environ 1,40 $ sur H100 (1 056 s) | API |
| Un clip WAN 2.2 accéléré en 4 étapes | 0,05 $ en 480p | environ 0,02 à 0,03 $ sur RTX 4090 | serverless, de peu |

Le résultat vidéo surprend, et il s'explique. Les plateformes d'API ne font pas tourner WAN 2.2 comme le dépôt officiel : elles le répartissent sur plusieurs cartes, le compilent, réduisent la précision ou le nombre d'étapes, et amortissent le tout sur des milliers de clients. Le tableau officiel montre l'effet de la seule répartition : 53 secondes sur huit H100 au lieu de 328 sur une seule. Vous pouvez faire la même chose sur un worker loué, mais c'est un travail d'ingénieur, pas un réglage.

L'image, à l'inverse, ne demande rien de tel. Une RTX 4090 sort une image Flux dev en une dizaine de secondes avec un workflow ComfyUI standard, soit environ 0,003 $ de calcul, quatre fois moins que l'API. Mais ce chiffre suppose un worker déjà réveillé. Un démarrage à froid ajoute le chargement des poids du modèle, plus d'une dizaine de gigaoctets pour Flux dev, puis cinq secondes d'inactivité facturées par défaut : sur un appel isolé, l'avantage fond. Le serverless gagne quand les images arrivent par lots, pas quand elles arrivent une par une.

Reste la ligne que les tableaux oublient : le temps de construction. Un worker se prépare, avec une image Docker, un volume réseau pour les poids, un gestionnaire d'erreurs et une boucle de récupération. Il se surveille aussi. Sur le pipeline vidéo de ce site, WAN 2.2 tourne sur un worker Runpod Serverless à dix étapes. Un test de 41 images y a demandé 3 minutes 22 de calcul après 20 secondes de file, et certains jours la file a atteint neuf à dix minutes. La production des 84 clips de la vidéo sur kDrive y a coûté 6,54 $ sur RTX 4090 et RTX 5090, soit 0,078 $ par clip conservé : moins que WAN 2.2 standard à l'unité, plus que sa version accélérée. Rien de grave pour une production préparée à l'avance, mais ce sont des heures de réglage qu'une API vous épargne. Runpod le sait d'ailleurs très bien, puisqu'il vend lui-même WAN 2.2 en 720p au même prix que WaveSpeed, 0,30 $ le clip, sur ses points d'accès publics.

Mon seuil pratique tient en deux phrases. Pour l'image, passez au serverless quand vous générez plusieurs milliers d'images par mois par lots réguliers, avec un modèle ouvert que vous connaissez bien. Pour la vidéo, restez sur l'API, sauf si vous acceptez un modèle accéléré et que vous produisez des centaines de clips par mois.

![Illustration : aiguillage ferroviaire de laiton dans une gare sombre, une voie menant vers un guichet éclairé, l'autre vers une grande salle des machines](/images/api-inference-ou-gpu-serverless-quand-aiguillage.original.webp "L'aiguillage se règle au volume : peu de trains, le guichet ; des convois entiers, la salle des machines.")

### Si vous restez sur l'API pour la vidéo

Une vidéo prend plusieurs minutes à sortir, et l'interroger toutes les deux secondes n'est pas la bonne méthode. Les alternatives sont décrites dans [les jobs longs sans polling](/guides/gpu-cloud-ia/api-inference-media/webhooks-polling-jobs-longs-api-media/).

### Si vous voulez comparer les API avant de comparer le GPU

L'écart entre deux API dépasse parfois l'écart entre une API et un worker loué : Flux dev coûte de 0,0038 $ à 0,025 $ selon la plateforme. Le relevé complet est dans [le prix d'une génération, plateforme par plateforme](/guides/gpu-cloud-ia/api-inference-media/cout-api-inference-media-comparatif/).

### Si vous voulez partir de la grille WaveSpeed

Le seuil dépend du modèle et de la résolution que vous utilisez vraiment. Les prix de chaque modèle, images, vidéo et voix, sont dans [la grille par génération](/guides/gpu-cloud-ia/api-inference-media/tarifs-api-media-par-generation/).


---

Cette page contient des liens d'affiliation. Si tu souscris via ces liens, je peux toucher une commission sans coût supplémentaire pour toi. Mon avis reste indépendant et basé sur mon usage réel des outils que je recommande.


---

**Tarifs :** prix relevés le 27 septembre 2026 sur les sites officiels des fournisseurs, dans la devise qu'ils affichent : dollars américains pour les plateformes américaines, euros hors taxes pour les européennes. Les tarifs du GPU bougent souvent, et sur une place de marché chaque hôte fixe son prix : les montants cités peuvent avoir changé depuis cette date.

