Québec, Canada

403-1381 1re Avenue

+1 581.849.27.96

bdgouthiere@gmail.com

Une chaîne vidéo IA complète, de la première image au montage

Ou : comment une vidéo de six minutes tient dans huit dollars, un dossier de scripts et beaucoup de patience.

La réponse courte : une vidéo IA complète enchaîne six maillons, et chacun a son outil ouvert. Les images de départ, puis les clips animés avec WAN 2.2, la voix off avec Qwen3-TTS, la musique avec ACE-Step, les sous-titres avec faster-whisper, et le montage avec ffmpeg et Remotion. Sur la vidéo sur kDrive publiée avec ce site, un peu plus de six minutes, l’ensemble a coûté 8,43 $ de GPU loué à la seconde chez Runpod, la voix et la musique ayant tourné gratuitement sur Colab. Ce qui ne s’automatise pas, c’est le script, le choix des images et le contrôle de chaque clip. C’est l’aboutissement de produire de la vidéo IA avec des modèles ouverts.

L’organisation compte plus que les outils. La vidéo est découpée en scènes, et chaque scène vit dans son dossier, avec un fichier de prompts pour les images, un script Python pour les clips, et ses fichiers produits. Le script d’une scène fait tout le travail mécanique : il redimensionne chaque image au format de sortie, l’envoie en base64 au worker WAN 2.2 sur la route asynchrone de Runpod Serverless, interroge le statut toutes les quinze secondes, décode la vidéo reçue, puis assemble les clips de la scène avec des fondus de 0,8 seconde grâce au filtre xfade de ffmpeg. La première scène, par exemple, enchaîne sept clips de cinq secondes pour 30,2 secondes, calées sur la durée de la voix.

La cohérence visuelle se règle en amont. Chaque fichier de prompts d’images commence par une charte : style, palette de quatre couleurs, grammaire visuelle. Les images d’une scène sont indépendantes, mais partagent cette charte, ce qui permet de les enchaîner sans rupture. C’est la raison pour laquelle la chaîne part d’images et non de texte : le modèle vidéo n’invente que le mouvement.

Pour qui : un créateur ou un développeur qui veut produire des vidéos entières avec des modèles ouverts, et payer la carte graphique seulement quand une scène tourne.

À partir de : 0,00031 $ la seconde de RTX 4090 en serverless, soit 1,10 $ de l’heure, et rien quand aucun job ne tourne.

Pour démarrer : ouvrir un compte Runpod, déployer un worker serverless WAN 2.2 image vers vidéo, puis envoyer les images d’une première scène par la route asynchrone.

Automatiser une vidéo IA : la chaîne de l’image au montage, maillon par maillon

MaillonOutilOù il tourneCoût mesuré
Script, découpage en scènes, charte visuellerédigés à la mainlocal0 $
84 images de départworker ComfyUIRunpod Serverless, A401,84 $
84 clips de cinq secondesWAN 2.2 image vers vidéo, 832 x 480, 10 étapesRunpod Serverless, RTX 4090 et 50906,54 $
16 segments de voix offQwen3-TTS, Apache 2.0Colab gratuit0 $
MusiqueACE-Step, Apache 2.0Colab gratuit, carte L40 $
Sous-titres et minutagefaster-whisperRunpod Serverless, RTX 40900,05 $
Assemblage des scènesffmpeg, fondus de 0,8 slocal0 $
Montage final, habillage, sous-titresRemotionlocal0 $
Total8,43 $

Coûts tirés de l’historique de facturation Runpod du compte du site, relu le 27 septembre 2026 ; licences vérifiées le 28 septembre 2026.

Les maillons audio méritent quelques détails. La voix off est découpée en seize segments, un par passage du script, générés avec Qwen3-TTS, un modèle d’Alibaba sous Apache 2.0, dans un carnet Colab gratuit. La musique vient d’ACE-Step, lui aussi sous Apache 2.0, qui tourne sur la carte L4 de Colab et produit des morceaux de quatre minutes au plus. La transcription, enfin, sert à la fois aux sous-titres et au minutage du montage : faster-whisper sur un worker serverless a retranscrit les seize voix, 1 138 mots en 82 phrases, en cinq minutes environ avec quatre workers en parallèle. Ses erreurs sur les sigles ont été corrigées depuis le script source, qui fait foi.

Le montage final se fait en code, avec Remotion, une bibliothèque qui décrit une vidéo en composants React : l’introduction et la conclusion de la chaîne, les scènes, la musique et les sous-titres y sont placés à partir du minutage de la transcription. Remotion est gratuit pour un particulier ou une entreprise de trois salariés au plus, usage commercial compris ; au-delà, il faut une licence d’entreprise. Le rendu tourne en local, sans carte graphique louée.

Avec le recul, deux maillons se feraient autrement aujourd’hui. Les images de départ ont coûté 0,022 $ pièce sur un worker serverless ; une API comme MiniMax Image-01, à 0,0035 $ l’image, aurait coûté 0,29 $ pour les 84. Et la boucle d’attente des clips doit prévoir la file de Runpod, qui a parfois retenu un job neuf à dix minutes : le délai du script est passé de dix à trente minutes pour ne plus perdre de clips payés.

Mon conseil pour une première vidéo : automatisez d’abord le maillon le plus répétitif, les clips, avec un script par scène, et gardez le reste à la main. Une chaîne entièrement automatique produit vite, mais une vidéo où personne n’a regardé chaque clip se voit, et YouTube ne la paie pas.

Tout ce qui précède se loue à la seconde ; la table de montage, elle, reste à la maison.

Si vous commencez par le maillon des clips

L’installation de WAN 2.2, les réglages du worker et la mesure d’un clip sont dans animer une image sur GPU loué.

Si un présentateur doit apparaître à l’écran

Un avatar parlant ajoute un maillon entre la voix et le montage. Les outils ouverts et leurs licences sont dans le lipsync et les avatars IA.

Si les clips doivent passer en 1080p

Les clips de 480p gagnent à être agrandis et fluidifiés avant le montage. Les outils et leur coût sont dans upscale et interpolation vidéo.