Trois générateurs vidéo ouverts face à face : qualité, VRAM, vitesse
Ou : trois ateliers de cinéma, trois règlements intérieurs, et un seul qui ouvre sa porte aux Européens sans condition.
La réponse courte : pour un créateur ou une entreprise en Europe, WAN 2.2 gagne par défaut. Il est sous licence Apache 2.0 sans restriction, anime une image en 480p ou en 720p, et existe en deux tailles : un modèle de 5 milliards de paramètres qui tient sur une RTX 4090, et un modèle de 14 milliards de paramètres actifs qui en demande 80 Go sans optimisation. HunyuanVideo 1.5 est plus léger, 8,3 milliards de paramètres et 14 Go au minimum, mais sa licence ne s’applique pas dans l’Union européenne. LTX-2.5 va plus loin, avec le son synchronisé et une sortie jusqu’en 4K, et reste gratuit sous 10 millions de dollars de chiffre d’affaires, à condition de livrer ses coordonnées pour le télécharger. C’est le premier choix à faire avant de parler d’image-to-video en open source : celui du modèle, parce qu’il décide de la carte, du prix et de ce que vous avez le droit d’en faire.
La qualité, elle, se prête mal au classement. Le classement image vers vidéo d’Artificial Analysis, fondé sur les votes d’utilisateurs, place MiniMax H3 en deuxième position avec un score Elo de 1 181, meilleur modèle à poids ouverts, puis LTX-2.5 Fast à la 22e place ; il n’affichait, quand je l’ai lu, ni WAN 2.2 ni HunyuanVideo 1.5. Or MiniMax H3 est hors jeu pour un Européen : sa licence exclut l’Union européenne, le Royaume-Uni, la Corée du Sud et les États-Unis, résultats compris. Faute de mesure indépendante sur les trois modèles, ce comparatif s’en tient à ce qui se vérifie : la résolution, la cadence, la durée, le son, la mémoire et le temps publié par chaque éditeur.
WAN 2.2 mérite une présentation, puisqu’il sert de référence partout. Ses modèles de 14 milliards reposent sur deux experts, l’un pour le bruit fort du début de la génération, l’autre pour le bruit faible de la fin : 27 milliards de paramètres au total, 14 actifs à chaque étape. Ils sortent 81 images à 16 images par seconde, soit un peu plus de cinq secondes. Le modèle de 5 milliards mélange texte et image en entrée et sort 121 images en 720p à 24 images par seconde. Les versions suivantes, de 2.5 à 3.0, existent chez Alibaba Cloud, mais uniquement par API : aucun poids n’a été publié.
Pour qui : un créateur ou une équipe qui veut choisir son modèle vidéo ouvert avant de louer la carte qui le fera tourner.
À partir de : 0,34 $ de l’heure pour une RTX 4090 de 24 Go en Community Cloud, 1,99 $ pour une H100 PCIe de 80 Go, facturés à la seconde.
Pour démarrer : ouvrir un compte Runpod, lancer un pod ComfyUI sur une RTX 4090, et charger WAN 2.2 en version 5 milliards ou 14 milliards en FP8.
WAN vs HunyuanVideo vs LTX : licence, mémoire et vitesse des générateurs vidéo ouverts
| Modèle | Paramètres | Licence | Sortie | Mémoire annoncée | Temps publié par l’éditeur |
|---|---|---|---|---|---|
| WAN 2.2 I2V-A14B | 27 milliards, 14 actifs | Apache 2.0 | 480p ou 720p, 81 images à 16 par seconde | 80 Go sur une seule carte | 328 s en 480p et 1 056 s en 720p sur H100 |
| WAN 2.2 TI2V-5B | 5 milliards | Apache 2.0 | 720p, 121 images à 24 par seconde | 24 Go, 8 Go avec le déchargement de ComfyUI | 525 s en 720p sur RTX 4090 |
| HunyuanVideo 1.5 | 8,3 milliards | Tencent Hunyuan Community, exclut l’UE | 480p ou 720p, 121 images, 1080p par super-résolution | 14 Go avec déchargement | non publié pour une seule carte |
| LTX-2.5 | 22 milliards | LTX-2.x Community, payante dès 10 M$ de chiffre d’affaires | vidéo et son, 24 images par seconde par défaut, jusqu’en 4K | non publiée | non publié |
| Kandinsky 5 Video Lite | 2 milliards | MIT | clips de 5 s, image vers vidéo disponible | non chiffrée | 139 s pour 5 s sur H100 en texte vers vidéo, 35 s en version distillée |
Caractéristiques relevées le 28 septembre 2026 dans les dépôts et fiches officiels ; temps pour une génération complète, sans optimisation tierce.
Les licences font la moitié du choix. Celle de HunyuanVideo 1.5 ne se contente pas d’exclure l’Europe du territoire couvert : elle interdit d’utiliser le modèle comme ses résultats hors de ce territoire. Une vidéo générée ailleurs puis publiée par une entreprise belge n’est donc pas plus couverte. La licence de LTX-2 est plus ouverte : gratuite en dessous de 10 millions de dollars de chiffre d’affaires, filiales comprises, sans exclusion territoriale, et sans droit revendiqué sur les vidéos produites. Mais les poids de LTX-2.5 sont derrière un formulaire sur Hugging Face, qui demande de partager ses coordonnées et d’accepter des offres commerciales ciblées. Kandinsky 5, sous licence MIT, n’impose rien de tel. Mochi 1, sous Apache 2.0, ne fait que du texte vers vidéo ; CogVideoX 5B exige une inscription pour un usage commercial.
Côté vitesse, le tableau officiel de WAN 2.2 donne l’ordre de grandeur que tout le monde cite : 328 secondes pour un clip 480p sur une H100, 810 sur une A100, et 525 secondes pour le modèle de 5 milliards en 720p sur une RTX 4090. Ces chiffres correspondent à 40 étapes, sans accélération. En pratique, presque personne ne tourne ainsi : la LoRA Lightning de Lightx2v, sous Apache 2.0, ramène la génération à 4 étapes, et la version FP8 de Kijai fait tenir le modèle de 14 milliards sur 24 Go. C’est la configuration du worker WAN 2.2 de ce site sur Runpod : environ trois minutes par clip de cinq secondes en 832 x 480 sur une RTX 4090, à dix étapes.
Mon choix est donc simple. WAN 2.2 pour tout usage commercial en Europe, en 5 milliards pour découvrir sur une carte de 24 Go, en 14 milliards FP8 avec accélération pour produire. LTX-2.5 si le son synchronisé ou la 4K comptent et que vous acceptez son formulaire. Kandinsky 5 si vous voulez une licence MIT et un modèle léger. HunyuanVideo, jamais, tant que sa licence exclut l’Europe.
Si vous avez choisi WAN 2.2
L’installation dans ComfyUI, les réglages qui comptent et le prix réel d’un clip sont détaillés dans animer une image avec WAN 2.2.
Si la mémoire décide pour vous
De 8 Go avec déchargement à 80 Go sans compromis, chaque modèle impose sa carte. Le choix est détaillé dans la carte à louer pour la vidéo générative.
Si vous hésitez entre partir d’une image ou d’un texte
Les trois modèles savent faire les deux, mais pas avec le même résultat. La différence est expliquée dans image vers vidéo ou texte vers vidéo.