La carte qu'il faut louer pour la vidéo générative sans attendre
Ou : pourquoi la carte la plus chère à l’heure peut être la moins chère au clip.
La réponse courte : pour WAN 2.2, une RTX 4090 de 24 Go suffit dans deux cas, le modèle de 5 milliards de paramètres et le modèle de 14 milliards en FP8 avec déchargement, et elle coûte 0,34 $ de l’heure. Sans optimisation, le 14 milliards monte à 41 Go en 480p et à 60 Go en 720p : il faut alors une carte de 48 Go pour la 480p, une A100 ou une H100 de 80 Go pour la 720p. Et à qualité égale, la H100 coûte moins cher au clip que l’A100, parce qu’elle va près de deux fois et demie plus vite pour un prix de 1,7 à 2,3 fois plus élevé. C’est la question matérielle de la vidéo générative sur GPU, et elle se règle au clip, pas à l’heure.
La mémoire d’abord, parce qu’elle décide de ce qui tourne. Le dépôt officiel de WAN 2.2 mesure les pics de mémoire de ses modèles : 41 Go pour un clip image vers vidéo en 480p avec le 14 milliards, 59,7 Go en 720p, et 22,8 Go pour le 5 milliards en 720p sur une RTX 4090. Ces chiffres supposent déjà le déchargement d’une partie du modèle vers la mémoire centrale. Les versions FP8 fournies par la documentation de ComfyUI divisent le poids de chaque expert par deux, de 28,6 à 14,3 Go, et c’est ce qui permet au worker WAN 2.2 de ce site de tourner sur des RTX 4090 et 5090.
Le temps ensuite, parce qu’il décide de la facture. Le même tableau mesure un clip 480p de 81 images à 40 étapes en 328 secondes sur une H100, 810 sur une A100, 1 117 sur une H20. La H100 va donc 2,5 fois plus vite que l’A100. Louée entre 1,99 et 2,69 $ de l’heure selon la variante chez Runpod, contre 1,19 $ pour l’A100 de 80 Go, elle revient à 0,18 à 0,25 $ le clip, contre 0,27 $ pour l’A100.
Pour qui : un créateur ou un développeur qui veut louer la carte juste suffisante pour ses clips, sans payer 80 Go quand 24 suffisent, ni attendre vingt minutes quand une H100 en met cinq.
À partir de : 0,34 $ de l’heure pour une RTX 4090 de 24 Go en Community Cloud, 0,79 $ pour une L40S de 48 Go, 1,19 $ pour une A100 de 80 Go, 1,99 $ pour une H100 PCIe.
Pour démarrer : ouvrir un compte Runpod, lancer un pod ComfyUI sur une RTX 4090 avec WAN 2.2 en FP8, et ne passer à 80 Go que pour la 720p sans compromis.
Quel GPU pour WAN 2.2 et la vidéo IA : mémoire, carte et coût par clip
| Usage | Mémoire nécessaire | Carte suffisante | Prix de l’heure en Community Cloud |
|---|---|---|---|
| WAN 2.2 TI2V-5B, 720p | 22,8 Go au pic, 8 Go avec le déchargement de ComfyUI | RTX 4090 | 0,34 $ |
| WAN 2.2 I2V-A14B en FP8, accéléré | 24 Go avec déchargement | RTX 4090 ou RTX 5090 | 0,34 $ ou 0,69 $ |
| WAN 2.2 I2V-A14B, 480p, sans optimisation | 41 Go au pic | L40S de 48 Go | 0,79 $ |
| WAN 2.2 I2V-A14B, 720p, sans optimisation | 59,7 Go au pic | A100 ou H100 de 80 Go | 1,19 $ ou 1,99 $ |
| Wan2.2-S2V, avatar parlant | 80 Go sur une seule carte | A100 ou H100 de 80 Go | 1,19 $ ou 1,99 $ |
| HunyuanVideo 1.5 | 14 Go avec déchargement | RTX 4090, mais licence exclue dans l’UE | 0,34 $ |
| SeedVR2, agrandissement d’un clip 720p | une H100 pour 100 images en 720p | H100 de 80 Go | 1,99 $ |
| Carte | Temps d’un clip I2V-A14B 480p, 40 étapes | Coût du clip |
|---|---|---|
| H100 | 328 s | 0,18 à 0,25 $ |
| A100 80 Go | 810 s | 0,27 $ |
| RTX 4090, 5 milliards en 720p | 525 s | 0,05 $ |
Mémoire et temps tirés des dépôts officiels ; prix Runpod relevés le 28 septembre 2026, coût du clip calculé au prix de l’heure.
Le tableau de coût se lit avec une réserve : ce sont des temps à 40 étapes, sans accélération. Avec la LoRA Lightning, qui ramène la génération à quatre étapes, ou avec les dix étapes du pipeline de ce site, tous les temps fondent, et la RTX 4090 devient la carte la plus rentable : environ trois minutes par clip 480p avec le 14 milliards en FP8, soit moins de deux centimes. La hiérarchie H100 contre A100, elle, reste la même, puisque l’accélération profite aux deux.
Deux cartes méritent un mot de plus. La RTX 5090, avec ses 32 Go, laisse une marge confortable au 14 milliards en FP8 et coûte 0,69 $ de l’heure en Community Cloud ; le worker du site y a tourné une partie du temps, mais sur un historique où la RTX 4090 a fait 91 % du travail, rien ne permet de chiffrer l’écart de vitesse. La L40S de 48 Go, à 0,79 $, fait tourner le 14 milliards en 480p sans quantification, pour qui veut la qualité d’origine sans payer l’A100 ; d’autres cartes de 48 Go, comme l’A40, le permettent aussi.
Ma règle tient en trois paliers. Pour découvrir et pour produire avec un modèle accéléré, une RTX 4090. Pour la 480p en qualité d’origine, une L40S. Pour la 720p en qualité d’origine, une H100 plutôt qu’une A100 : plus chère à l’heure, moins chère au clip, et deux fois et demie moins d’attente.
Si vous avez choisi votre carte
L’installation de WAN 2.2 sur le pod, les fichiers à télécharger et le prix mesuré d’un clip sont dans WAN 2.2 sur un GPU loué.
Si vous hésitez encore sur le modèle
HunyuanVideo tient sur une 4090, mais sa licence exclut l’Europe ; LTX-2.5 ne publie aucun chiffre de mémoire. Le comparatif est dans WAN, HunyuanVideo et LTX face à face.
Si vous agrandissez vos clips ensuite
L’agrandissement en 1080p ou en 4K demande parfois plus de mémoire que la génération elle-même. Les outils et leur prix sont dans passer un clip en 4K et 60 images par seconde.