Québec, Canada

403-1381 1re Avenue

+1 581.849.27.96

bdgouthiere@gmail.com

Partir d'une image ou d'un texte : ce que ça change à l'écran

Ou : la différence entre commander un tableau par téléphone et apporter la photo au peintre.

La réponse courte : en texte vers vidéo, le modèle invente tout, le cadre, le décor, les personnages et le mouvement, à partir d’une phrase. En image vers vidéo, vous fixez la première image, et le modèle n’invente plus que le mouvement. La première méthode sert à explorer des idées ; la seconde sert à produire, parce qu’elle garantit que le personnage du clip 12 ressemble à celui du clip 3. Le prix d’un clip est le même dans les deux cas, 0,15 $ chez WaveSpeed pour WAN 2.2 en 480p, et le temps de calcul aussi. L’image de départ ajoute un coût, mais il se compte en fractions de centime. C’est la première décision à prendre dans la vidéo générative sur GPU, avant même le choix du modèle.

La différence tient à ce que le modèle doit deviner. Un prompt de texte, même long, laisse ouvertes des milliers de questions : l’angle de la caméra, la lumière, la couleur exacte de la veste, la forme du visage. Le modèle y répond au hasard de la graine aléatoire, différemment à chaque génération. L’image de départ répond à toutes ces questions d’un coup. Le prompt, lui, ne décrit plus que ce qui doit bouger : la tête qui se tourne, la caméra qui avance, la fumée qui monte.

Les modèles ouverts suivent cette logique. WAN 2.2 publie deux modèles distincts de 14 milliards de paramètres actifs, T2V-A14B pour le texte et I2V-A14B pour l’image, et un modèle de 5 milliards qui accepte les deux en entrée. Son tableau de performances montre des temps presque identiques : 327 secondes en texte vers vidéo et 328 en image vers vidéo, pour un clip 480p sur une H100. Le calcul ne fait donc pas la différence ; le contrôle, si.

Pour qui : un créateur qui se demande s’il doit écrire ses clips ou les dessiner d’abord, et ce que chaque méthode change au budget.

À partir de : 0,34 $ de l’heure pour une RTX 4090 de 24 Go en Community Cloud, où les deux modes de WAN 2.2 tournent de la même façon, facturés à la seconde.

Pour démarrer : ouvrir un compte Runpod, lancer un pod ComfyUI sur une RTX 4090, et essayer le même prompt en texte vers vidéo puis à partir d’une image.

Image to video ou text to video : ce qui change, du contrôle au coût

CritèreTexte vers vidéoImage vers vidéo
Ce que vous fixezune descriptionla première image, puis le mouvement
Cohérence d’un clip à l’autrefaible, chaque génération réinvente le personnageforte, les images de départ partagent le style
Prix d’un clip WAN 2.2 480p chez WaveSpeed0,15 $0,15 $, plus l’image de départ
Temps de calcul sur H100, 480p327 s328 s
Coût d’une image de départ par APIaucun0,0035 $ avec MiniMax Image-01
Meilleur usageexplorer une idée, un plan d’ambianceune série, un produit, un personnage récurrent

Prix et temps relevés le 28 septembre 2026 ; temps tirés du tableau officiel de WAN 2.2, à 40 étapes.

Le cas du pipeline de ce site illustre le choix. Pour la vidéo sur kDrive, les 84 clips sont partis de 84 images générées d’abord, dans un style commun décrit une fois pour toutes : palette, lumière, registre visuel. Chaque clip n’avait plus qu’à animer sa scène. En texte vers vidéo, il aurait fallu espérer que le modèle retrouve à chaque fois la même ambiance, et refaire les clips qui s’en écartaient. L’image de départ coûte un peu, mais elle évite les reprises, qui sont le vrai poste caché d’une production vidéo.

Entre les deux méthodes, des variantes se sont installées. LTX-2.5 propose dans ses workflows ComfyUI un mode première et dernière image : vous fixez le début et la fin, le modèle invente le trajet. SkyReels V3 part de une à quatre images de référence, pour garder un personnage sans figer le cadre. Ces modes demandent plus de préparation, mais donnent encore plus de contrôle sur le montage final.

Ma règle est simple : texte vers vidéo pour chercher, image vers vidéo pour produire. Un clip d’essai en texte coûte le même prix qu’un clip définitif ; il sert à trouver le mouvement et le cadrage qui fonctionnent. Dès qu’une vidéo compte plus de deux ou trois plans, ou qu’un personnage revient, générez d’abord les images, validez-les, puis animez-les.

Derrière la première porte, le décor est déjà posé ; derrière la seconde, tout reste à inventer, y compris ce que vous ne vouliez pas.

Si vous devez choisir le modèle

WAN, HunyuanVideo et LTX ne donnent pas le même contrôle ni les mêmes droits. Le face-à-face est dans les générateurs vidéo ouverts comparés.

Si vous préparez une série de clips

Des images de départ au montage final, avec les voix et la musique, la chaîne complète est décrite dans une vidéo IA de la première image au montage.

Si vous comptez le budget en secondes

Chaque méthode et chaque plateforme ont leur prix par seconde. Le relevé complet est dans combien coûte une seconde de vidéo générée.