Animer une image avec WAN 2.2 sur un GPU loué : le coût du clip
Ou : comment faire bouger une photo pendant cinq secondes, et ce que coûtent ces cinq secondes.
La réponse courte : WAN 2.2 s’installe dans ComfyUI sur un pod loué en une demi-heure, avec les workflows officiels. Sur une RTX 4090 à 0,34 $ de l’heure, la version de 14 milliards de paramètres, en FP8 et accélérée par une LoRA, anime une image en clip de cinq secondes en 832 x 480 en trois minutes environ : moins de deux centimes de calcul si la carte ne chôme pas. Le même clip coûte 0,15 $ chez WaveSpeed en qualité standard, 0,05 $ en version accélérée. Sur le pipeline de ce site, facture serverless comprise, un clip conservé est revenu à 0,078 $. C’est la brique de base de produire de la vidéo IA avec un modèle ouvert.
WAN 2.2, publié par Alibaba en juillet 2025 sous licence Apache 2.0, existe en deux tailles utiles pour l’image vers vidéo. Le modèle I2V-A14B repose sur deux experts de 14 milliards de paramètres chacun, l’un pour le début de la génération, l’autre pour la fin ; il sort 81 images à 16 images par seconde, en 480p ou en 720p. Le modèle TI2V-5B, plus léger, sort 121 images en 720p à 24 images par seconde, et selon le dépôt officiel il génère un clip de cinq secondes en moins de neuf minutes sur une carte grand public.
Le 14 milliards est le plus demandé, et c’est là que la mémoire pose problème : le dépôt officiel annonce 80 Go pour le faire tourner sur une seule carte. En pratique, la communauté a résolu le problème. La documentation de ComfyUI sur WAN 2.2 fournit chaque expert en FP8, 14,3 Go par fichier, et le modèle de 5 milliards tient en 8 Go grâce au déchargement automatique de ComfyUI.
Pour qui : un créateur ou un développeur qui veut animer ses propres images avec un modèle ouvert, et payer la carte plutôt que chaque clip.
À partir de : 0,34 $ de l’heure pour une RTX 4090 de 24 Go en Community Cloud, 0,69 $ pour une RTX 5090 de 32 Go, facturés à la seconde.
Pour démarrer : ouvrir un compte Runpod, lancer le modèle de pod ComfyUI sur une RTX 4090, puis charger le workflow WAN 2.2 image vers vidéo depuis les modèles de ComfyUI.
WAN 2.2 image to video sur GPU cloud : l’installation et le prix d’un clip
| Étape | Ce qu’il faut savoir |
|---|---|
| Choisir le pod | modèle officiel ComfyUI de Runpod, RTX 4090 pour le FP8, carte de 80 Go pour le modèle complet |
| Télécharger les poids | deux experts I2V-A14B en FP8 de 14,3 Go chacun, l’encodeur de texte, le VAE ; ou le TI2V-5B de 10 Go |
| Accélérer | la LoRA Lightning de Lightx2v, sous Apache 2.0, ramène la génération de 40 étapes à 4 |
| Régler la sortie | 81 images à 16 par seconde pour le 14 milliards, en 832 x 480 ou 1280 x 720 ; un nombre d’images de la forme 4n + 1 |
| Préparer l’image | recadrée au format de sortie avant l’envoi, comme le fait le script du site |
| Méthode | Clip de 5 s en 480p | Clip de 5 s en 720p |
|---|---|---|
| RTX 4090 louée en pod, 14 milliards FP8 accéléré, environ 3 minutes | 0,017 $ environ | non mesuré |
| Pipeline serverless de ce site, facture réelle | 0,078 $ | non produit |
| WaveSpeed, WAN 2.2 standard | 0,15 $ | 0,30 $ |
| WaveSpeed, WAN 2.2 accéléré | 0,05 $ | 0,10 $ |
| fal.ai, WAN 2.2 standard | 0,20 $ environ | 0,40 $ environ |
| Replicate, WAN 2.2 standard | 0,40 $ | 1 $ |
Prix relevés le 28 septembre 2026. Le coût en pod est un calcul : trois minutes à 0,34 $ de l’heure, carte occupée sans interruption.
La mesure du site mérite d’être détaillée, parce qu’elle sert de repère. Le worker WAN 2.2 du pipeline vidéo, publié sur GitHub par un tiers, charge le modèle I2V-A14B en FP8 et la LoRA Lightning, dans ComfyUI, et tourne sur Runpod Serverless. Au test d’avril 2026, un clip de 41 images en 480 x 832, à dix étapes et un guidage de 2, a demandé 202 secondes de calcul après 20 secondes de file d’attente. En production, 84 clips de 81 images en 832 x 480 ont demandé environ trois minutes de carte chacun, pour des fichiers de 391 à 931 Ko. La facture, elle, compte 240 secondes par clip conservé, reprises et réveils du worker compris : 6,54 $ pour les 84 clips.
Le calcul change de sens avec la qualité. Sans accélération, à 40 étapes, le tableau officiel de WAN 2.2 mesure 328 secondes pour un clip 480p sur une H100 et 1 056 secondes en 720p. Sur une H100 louée de 1,99 à 2,69 $ de l’heure selon la variante, que le tableau ne précise pas, cela fait de 0,18 à 0,25 $ le clip en 480p et de 0,58 à 0,79 $ en 720p, plus cher que WaveSpeed dans les deux cas. La carte louée ne gagne donc qu’avec un modèle accéléré, et moins d’étapes reste un compromis à juger sur vos propres clips.
Ma recommandation : pour découvrir, le modèle de 5 milliards sur une RTX 4090, sans rien optimiser. Pour produire des dizaines de clips, le 14 milliards en FP8 avec la LoRA Lightning, sur la même carte, en gardant un œil sur la qualité du mouvement. Pour quelques clips en 720p sans compromis, l’API reste moins chère que l’heure de H100.
Si vous hésitez sur la carte
La 4090 suffit avec le FP8, une carte de 80 Go devient nécessaire sans optimisation. Le choix et le coût par clip de chaque carte sont dans le GPU à louer pour WAN 2.2.
Si vous voulez comparer avec toutes les API
WAN, Kling, Veo, Seedance : le prix d’une seconde générée, modèle par modèle et plateforme par plateforme, est dans le coût d’une seconde de vidéo IA.
Si vous enchaînez les clips pour une vraie vidéo
Un clip seul ne fait pas une vidéo. L’enchaînement des images, des clips, des voix et du montage est décrit dans une chaîne vidéo IA complète.