Québec, Canada

403-1381 1re Avenue

+1 581.849.27.96

bdgouthiere@gmail.com

Traduire et doubler une vidéo en trois langues sans studio

Ou : comment faire parler votre vidéo en espagnol et en allemand sans louer un studio ni apprendre les deux langues.

La réponse courte : un doublage IA enchaîne quatre étapes, et chacune a son outil ouvert. Transcrire avec faster-whisper, traduire avec un modèle de langage, revoicer avec un TTS qui garde votre voix d’une langue à l’autre, comme Qwen3-TTS ou CosyVoice 3, puis caler la nouvelle piste sur l’image. Sur une RTX 4090 louée, une vidéo de dix minutes doublée en trois langues coûte quelques centimes de calcul. Les services clés en main facturent de 0,33 $ à 2,20 $ la minute chez ElevenLabs, 1,56 $ chez Rask au premier palier mensuel. Les modèles de traduction les plus connus de Meta, en revanche, sont interdits d’usage commercial. C’est l’usage le plus complet de Whisper et TTS dans le cloud.

La traduction est l’étape où les licences piègent. SeamlessM4T v2, de Meta, traduit directement la parole en parole dans 35 langues de sortie, mais ses poids sont sous licence CC-BY-NC. NLLB-200, qui traduit le texte entre 200 langues, est aussi non commercial, et sa fiche précise qu’il s’agit d’un modèle de recherche, pas de production. La voie la plus sûre passe par un modèle de langage à licence ouverte ou par une API, qui traduit la transcription en respectant le registre et la longueur des phrases, contrainte essentielle pour un doublage.

Le revoicing, ensuite, demande un modèle qui clone votre voix dans une autre langue. CosyVoice 3, sous Apache 2.0, annonce ce clonage d’une langue à l’autre dans neuf langues ; Qwen3-TTS, sous Apache 2.0 aussi, clone une voix à partir de trois secondes, dans dix langues. Kyutai propose Hibiki, qui traduit le français vers l’anglais en direct en gardant la voix, sous licence CC-BY, mais dans ce seul sens.

Pour qui : un créateur, un formateur ou une entreprise qui veut publier ses vidéos dans plusieurs langues avec sa propre voix, sans payer chaque minute doublée.

À partir de : 0,34 $ de l’heure pour une RTX 4090 de 24 Go en Community Cloud, 0,74 $ en Secure Cloud, facturés à la seconde.

Pour démarrer : ouvrir un compte Runpod, lancer un pod PyTorch sur une RTX 4090, puis installer un outil de doublage ouvert comme SoniTranslate ou VideoLingo pour un premier essai.

Doublage IA d’une vidéo : la chaîne ouverte et le prix des services

ÉtapeOutil ouvertLicenceÀ savoir
Transcrirefaster-whisperMIThorodatage au mot pour caler la traduction
Traduiremodèle de langage à licence ouverte, ou APIselon le modèleéviter NLLB-200 et SeamlessM4T, non commerciaux
RevoicerQwen3-TTS, CosyVoice 3, Chatterbox multilingueApache 2.0 ou MITclonage de la voix d’une langue à l’autre
Caler sur l’imageffmpeg, ajustement de la vitesselibrela traduction change la longueur des phrases
Synchroniser les lèvres, en optionMuseTalk, LatentSyncMIT, Apache 2.0seulement si le visage est à l’écran
Tout enchaînerSoniTranslate, VideoLingo, pyVideoTransApache 2.0, Apache 2.0, GPL-3.0la licence de l’outil ne couvre pas celle des modèles qu’il appelle
ServicePrixÀ savoir
ElevenLabs Dubbing, par API0,33 $ la minute avec filigrane, 0,50 $ sansv2, 92 langues : 2,20 $ la minute
Rask.aiCreator à 39 $ par mois pour 25 minutessynchronisation labiale à partir de Creator Pro, 99 $
Azure Video Translationde 0,33 à 0,42 $ la minute, calcul sur la grille horaire
Murf Dubà partir de 0,50 $ la minute par langue
HeyGenà partir de 29 $ par moisprix de la minute traduite non publié

Prix et licences relevés le 28 septembre 2026 sur les grilles, fiches et dépôts officiels.

Le calcul du coût en autonomie tient en quelques lignes. Pour une vidéo de dix minutes doublée en trois langues, la transcription prend une vingtaine de secondes de carte, la traduction par un modèle de langage quelques centimes au plus, et les trente minutes de voix à produire une dizaine de minutes de RTX 4090, à la vitesse publiée par VoxCPM2. Total : moins de dix centimes de carte à 0,34 $ de l’heure, hors installation et relecture. Le même travail chez ElevenLabs, sans filigrane, coûte 15 $ ; chez Rask, il dépasse le forfait mensuel de base.

L’écart se paie en temps et en vigilance. Les outils de doublage ouverts enchaînent les étapes, mais rien ne garantit qu’une réplique traduite tienne dans le temps de l’originale, ni qu’un nom propre ou un sigle soit prononcé correctement dans chaque langue. Il faut relire la traduction, écouter chaque langue et ajuster, idéalement avec quelqu’un qui parle la langue d’arrivée.

Ma chaîne recommandée : faster-whisper en large-v3 pour la transcription, un modèle de langage pour la traduction, avec la consigne de garder des phrases de longueur proche, Qwen3-TTS pour revoicer avec votre propre voix, et ffmpeg pour caler la piste. La synchronisation labiale seulement pour les plans où votre visage parle face caméra. Et une relecture humaine dans chaque langue avant publication.

Une seule voix, trois pavillons : le modèle garde le timbre, la relecture garde le sens.

Si vous commencez par la transcription

L’horodatage au mot est la base du doublage. Le modèle et les réglages sont dans faster-whisper sur un GPU loué.

Si vous doublez avec la voix d’un autre

Doubler avec votre voix ne pose pas de question ; avec celle d’un comédien ou d’un collègue, si. Les règles sont dans cloner une voix : consentement et limites.

Si vous préférez des sous-titres traduits

Sous-titrer est moins cher et plus rapide que doubler. La chaîne des sous-titres est dans les sous-titres automatiques de bout en bout.