Des clips IA depuis vos images : WAN 2.2 sur GPU loué à l'heure
Ou : ce que coûte le cinéma quand la caméra se loue à la seconde et que les acteurs sortent d’une photo.
Une seconde de vidéo générée par IA coûte entre un centime et quarante centimes par API. La même seconde, produite avec WAN 2.2 sur une RTX 4090 louée 0,34 $ de l’heure, coûte moins d’un demi-centime si la carte ne s’arrête jamais, et environ un centime et demi dans la vraie vie, réveils du serveur et clips refaits compris : c’est ce qu’a coûté la vidéo sur kDrive publiée avec ce site. Entre ces chiffres, il y a des choix : le modèle et sa licence, la carte et sa mémoire, la méthode de production et ce que la plateforme de diffusion accepte de payer. C’est le guide des fournisseurs GPU cloud qui compare les loueurs de cartes ; cette section s’occupe de ce qu’on fait avec une carte quand on veut des clips.
Le paysage est plus simple qu’il n’y paraît pour un créateur européen. WAN 2.2, publié par Alibaba en juillet 2025 sous licence Apache 2.0, sert de référence ouverte pour l’image vers vidéo : 480p ou 720p, cinq secondes par clip, un modèle de 5 milliards de paramètres qui tient sur une carte de 24 Go et un modèle de 14 milliards qui, optimisé, y tient aussi. Ses concurrents ont chacun une limite : HunyuanVideo exclut l’Union européenne de sa licence, LTX-2.5 demande vos coordonnées pour télécharger ses poids, et les versions récentes de WAN, de 2.5 à 3.0, ne sont disponibles que par API.
Le coût, lui, se joue sur le nombre d’étapes. À 40 étapes, en qualité d’origine, un clip 720p demande près de dix-huit minutes de H100, et l’API gagne à tous les coups. Avec une accélération à quatre ou dix étapes, le même travail tient en trois minutes de RTX 4090, et la carte louée repasse devant. D’où la question qui traverse cette section : quel compromis de qualité acceptez-vous pour diviser le prix du clip ?
Pour qui : un créateur vidéo ou un développeur qui veut produire des clips à partir de ses images avec des modèles ouverts, sur une carte louée à la seconde.
À partir de : 0,34 $ de l’heure pour une RTX 4090 de 24 Go en Community Cloud, 0,74 $ en Secure Cloud, 1,99 $ pour une H100 PCIe de 80 Go.
Pour démarrer : ouvrir un compte Runpod, lancer le modèle de pod ComfyUI sur une RTX 4090, et animer une première image avec WAN 2.2.
Vidéo générative open source : le coût d’une seconde de clip sur GPU loué
Neuf questions reviennent quand on produit des clips sur une carte louée, et chacune a sa page, avec les prix relevés le 28 septembre 2026.
Animer sa première image
Une demi-heure d’installation dans ComfyUI, deux experts de 14,3 Go en FP8, et un clip de cinq secondes en trois minutes sur une RTX 4090. Les fichiers, les réglages et la mesure sont dans WAN 2.2 en image vers vidéo sur GPU loué.
Partir d’une image ou d’un texte
Même prix, même temps de calcul, mais pas le même contrôle : le texte explore, l’image produit. La différence est dans image vers vidéo ou texte vers vidéo.
Choisir le modèle
WAN 2.2 sous Apache 2.0, HunyuanVideo exclu de l’Europe, LTX-2.5 derrière un formulaire, Kandinsky 5 sous MIT. Le face-à-face est dans les générateurs vidéo ouverts comparés.
Le prix d’une seconde
De 0,01 $ la seconde pour WAN 2.2 accéléré à 0,40 $ pour Veo 3.1 avec le son, et 0,015 $ sur la facture réelle du site. Le relevé est dans le coût d’une seconde de vidéo générée.
La carte à louer
Une RTX 4090 pour le FP8, une L40S pour la 480p d’origine, une H100 plutôt qu’une A100 pour la 720p, parce qu’elle coûte moins cher au clip. Le détail est dans le GPU pour WAN 2.2.
De l’image au montage
Images, clips, voix, musique, sous-titres et montage : six minutes de vidéo pour 8,43 $ de carte louée. La chaîne est dans une vidéo IA de bout en bout.
Un avatar qui parle
MuseTalk pour doubler une vidéo filmée, InfiniteTalk ou EchoMimicV3 pour animer une photo, et Wav2Lip à éviter pour tout usage commercial. Les outils sont dans le lipsync open source sur GPU loué.
La 4K et la fluidité
RIFE pour passer de 16 à 48 images par seconde, FlashVSR ou SeedVR2 pour la 4K, quelques centimes par clip sur une carte louée. Les outils sont dans upscale et interpolation d’un clip IA.
Une chaîne qui se monétise
YouTube paie les clips générés s’ils servent un propos, refuse la production de masse, et relève ses seuils en février 2027. Les règles sont dans la vidéo IA sur YouTube.