# Une chaîne vidéo IA complète, de la première image au montage

> Images, clips WAN 2.2, voix, musique, sous-titres et montage : la chaîne vidéo IA du site étape par étape, ses outils ouverts et la facture de chaque maillon.


*Ou : comment une vidéo de six minutes tient dans huit dollars, un dossier de scripts et beaucoup de patience.*

La réponse courte : une vidéo IA complète enchaîne six maillons, et chacun a son outil ouvert. Les images de départ, puis les clips animés avec WAN 2.2, la voix off avec Qwen3-TTS, la musique avec ACE-Step, les sous-titres avec faster-whisper, et le montage avec ffmpeg et Remotion. Sur la vidéo sur kDrive publiée avec ce site, un peu plus de six minutes, l'ensemble a coûté 8,43 $ de GPU loué à la seconde chez Runpod, la voix et la musique ayant tourné gratuitement sur Colab. Ce qui ne s'automatise pas, c'est le script, le choix des images et le contrôle de chaque clip. C'est l'aboutissement de [produire de la vidéo IA](/guides/gpu-cloud-ia/video-generative-gpu-cloud/) avec des modèles ouverts.

L'organisation compte plus que les outils. La vidéo est découpée en scènes, et chaque scène vit dans son dossier, avec un fichier de prompts pour les images, un script Python pour les clips, et ses fichiers produits. Le script d'une scène fait tout le travail mécanique : il redimensionne chaque image au format de sortie, l'envoie en base64 au worker WAN 2.2 sur la route asynchrone de Runpod Serverless, interroge le statut toutes les quinze secondes, décode la vidéo reçue, puis assemble les clips de la scène avec des fondus de 0,8 seconde grâce au filtre [xfade de ffmpeg](https://ffmpeg.org/ffmpeg-filters.html#xfade). La première scène, par exemple, enchaîne sept clips de cinq secondes pour 30,2 secondes, calées sur la durée de la voix.

La cohérence visuelle se règle en amont. Chaque fichier de prompts d'images commence par une charte : style, palette de quatre couleurs, grammaire visuelle. Les images d'une scène sont indépendantes, mais partagent cette charte, ce qui permet de les enchaîner sans rupture. C'est la raison pour laquelle la chaîne part d'images et non de texte : le modèle vidéo n'invente que le mouvement.

> **Pour qui** : un créateur ou un développeur qui veut produire des vidéos entières avec des modèles ouverts, et payer la carte graphique seulement quand une scène tourne.
>
> **À partir de** : 0,00031 $ la seconde de RTX 4090 en serverless, soit 1,10 $ de l'heure, et rien quand aucun job ne tourne.
>
> **Pour démarrer** : ouvrir un compte Runpod, déployer un worker serverless WAN 2.2 image vers vidéo, puis envoyer les images d'une première scène par la route asynchrone.

## Automatiser une vidéo IA : la chaîne de l'image au montage, maillon par maillon

| Maillon | Outil | Où il tourne | Coût mesuré |
|---|---|---|---|
| Script, découpage en scènes, charte visuelle | rédigés à la main | local | 0 $ |
| 84 images de départ | worker ComfyUI | Runpod Serverless, A40 | 1,84 $ |
| 84 clips de cinq secondes | WAN 2.2 image vers vidéo, 832 x 480, 10 étapes | Runpod Serverless, RTX 4090 et 5090 | 6,54 $ |
| 16 segments de voix off | Qwen3-TTS, Apache 2.0 | Colab gratuit | 0 $ |
| Musique | ACE-Step, Apache 2.0 | Colab gratuit, carte L4 | 0 $ |
| Sous-titres et minutage | faster-whisper | Runpod Serverless, RTX 4090 | 0,05 $ |
| Assemblage des scènes | ffmpeg, fondus de 0,8 s | local | 0 $ |
| Montage final, habillage, sous-titres | Remotion | local | 0 $ |
| Total | | | 8,43 $ |

Coûts tirés de l'historique de facturation Runpod du compte du site, relu le 27 septembre 2026 ; licences vérifiées le 28 septembre 2026.

Les maillons audio méritent quelques détails. La voix off est découpée en seize segments, un par passage du script, générés avec [Qwen3-TTS](https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base), un modèle d'Alibaba sous Apache 2.0, dans un carnet Colab gratuit. La musique vient d'ACE-Step, lui aussi sous Apache 2.0, qui tourne sur la carte L4 de Colab et produit des morceaux de quatre minutes au plus. La transcription, enfin, sert à la fois aux sous-titres et au minutage du montage : faster-whisper sur un worker serverless a retranscrit les seize voix, 1 138 mots en 82 phrases, en cinq minutes environ avec quatre workers en parallèle. Ses erreurs sur les sigles ont été corrigées depuis le script source, qui fait foi.

Le montage final se fait en code, avec [Remotion](https://github.com/remotion-dev/remotion/blob/main/LICENSE.md), une bibliothèque qui décrit une vidéo en composants React : l'introduction et la conclusion de la chaîne, les scènes, la musique et les sous-titres y sont placés à partir du minutage de la transcription. Remotion est gratuit pour un particulier ou une entreprise de trois salariés au plus, usage commercial compris ; au-delà, il faut une licence d'entreprise. Le rendu tourne en local, sans carte graphique louée.

Avec le recul, deux maillons se feraient autrement aujourd'hui. Les images de départ ont coûté 0,022 $ pièce sur un worker serverless ; une API comme MiniMax Image-01, à 0,0035 $ l'image, aurait coûté 0,29 $ pour les 84. Et la boucle d'attente des clips doit prévoir la file de Runpod, qui a parfois retenu un job neuf à dix minutes : le délai du script est passé de dix à trente minutes pour ne plus perdre de clips payés.

Mon conseil pour une première vidéo : automatisez d'abord le maillon le plus répétitif, les clips, avec un script par scène, et gardez le reste à la main. Une chaîne entièrement automatique produit vite, mais une vidéo où personne n'a regardé chaque clip se voit, et YouTube ne la paie pas.

![Illustration : ancienne table de montage de film avec deux bobines de pellicule vierge et une petite visionneuse lumineuse, dans une pièce sombre éclairée par une lampe ambrée](/images/pipeline-video-ia-image-au-montage-table-montage.original.webp "Tout ce qui précède se loue à la seconde ; la table de montage, elle, reste à la maison.")

### Si vous commencez par le maillon des clips

L'installation de WAN 2.2, les réglages du worker et la mesure d'un clip sont dans [animer une image sur GPU loué](/guides/gpu-cloud-ia/video-generative-gpu-cloud/image-to-video-open-source-gpu/).

### Si un présentateur doit apparaître à l'écran

Un avatar parlant ajoute un maillon entre la voix et le montage. Les outils ouverts et leurs licences sont dans [le lipsync et les avatars IA](/guides/gpu-cloud-ia/video-generative-gpu-cloud/lipsync-avatars-ia-gpu-cloud/).

### Si les clips doivent passer en 1080p

Les clips de 480p gagnent à être agrandis et fluidifiés avant le montage. Les outils et leur coût sont dans [upscale et interpolation vidéo](/guides/gpu-cloud-ia/video-generative-gpu-cloud/interpolation-upscale-video-ia/).


---

Cette page contient des liens d'affiliation. Si tu souscris via ces liens, je peux toucher une commission sans coût supplémentaire pour toi. Mon avis reste indépendant et basé sur mon usage réel des outils que je recommande.


---

**Tarifs :** prix relevés le 28 septembre 2026 sur les sites officiels des fournisseurs, dans la devise qu'ils affichent : dollars américains pour les plateformes américaines, euros hors taxes pour les européennes. Les tarifs du GPU bougent souvent, et sur une place de marché chaque hôte fixe son prix : les montants cités peuvent avoir changé depuis cette date.

