Transcrire et synthétiser la voix sans abonnement à la minute
Ou : ce qu’il reste à payer quand la sténo, le comédien et le compositeur tiennent tous dans une carte graphique.
Une heure d’audio transcrite coûte de 0,04 $ à 0,36 $ par API. Une minute de voix de synthèse, de 0,015 $ chez OpenAI à 0,18 $ avec un abonnement ElevenLabs. Des chansons, dix dollars par mois chez Suno pour vingt téléchargements. Sur une RTX 4090 louée 0,34 $ de l’heure, les trois tombent à des fractions de centime, à condition de produire en volume et d’accepter d’installer les modèles. Pour comparer les loueurs de cartes, voir le guide qui permet de comparer les GPU cloud et les API IA ; cette section s’occupe de ce qu’on fait d’une carte quand on travaille le son.
Le paysage de l’audio ouvert a une particularité : les licences y piègent plus qu’ailleurs. Whisper et faster-whisper sont sous licence MIT, WhisperX sous BSD, et la transcription est donc libre. Pour la voix, en revanche, plusieurs modèles vedettes interdisent l’usage commercial, XTTS-v2, Fish Speech, F5-TTS, pendant que Qwen3-TTS et Chatterbox l’autorisent. Pour la musique, ACE-Step est sous MIT quand MusicGen, de Meta, est non commercial. Le dépôt de faster-whisper résume l’autre bonne nouvelle : une heure d’audio se transcrit en quelques dizaines de secondes de calcul sur une carte grand public.
Le site a fait l’expérience pour sa vidéo sur kDrive. Seize voix off générées avec Qwen3-TTS et la musique avec ACE-Step, dans des carnets Colab gratuits ; 372 secondes de voix transcrites avec faster-whisper en serverless sur RTX 4090, pour 0,05 $. Leçon inattendue : sur des fichiers courts, cette transcription est revenue plus cher à la minute d’audio que l’API d’OpenAI, à cause des démarrages. D’où la question qui traverse cette section : à partir de quel volume la carte louée gagne-t-elle vraiment ?
Pour qui : un podcasteur, un vidéaste, un formateur ou un développeur qui transcrit, sous-titre, double ou fait parler des voix de synthèse, et veut arrêter de payer chaque minute.
À partir de : 0,34 $ de l’heure pour une RTX 4090 de 24 Go en Community Cloud, 0,74 $ en Secure Cloud, facturés à la seconde.
Pour démarrer : ouvrir un compte Runpod, lancer un pod PyTorch sur une RTX 4090, et transcrire un premier fichier avec faster-whisper.
Whisper sur GPU cloud : ce que coûte une heure d’audio face aux API à la minute
Neuf questions reviennent quand on travaille le son sur une carte louée, et chacune a sa page, avec les prix relevés le 28 septembre 2026.
Transcrire une heure d’audio
faster-whisper en mode par lots, le modèle large-v3 pour le français, moins d’un centime de calcul par heure d’audio sur une RTX 4090. Les réglages et la mesure sont dans faster-whisper sur un GPU loué.
Payer la minute ou louer la carte
De 0,04 $ l’heure chez Groq à 0,36 $ chez OpenAI, et des API plus précises que Whisper en français. Le seuil de rentabilité est dans Whisper auto-hébergé ou API de transcription.
Les voix ouvertes en français
Qwen3-TTS et Chatterbox pour publier, Kyutai pour le bilingue, XTTS et Fish Speech à éviter pour tout usage commercial. Le comparatif est dans les TTS open source qui parlent français.
Cloner une voix sans enfreindre la loi
Trois secondes suffisent pour cloner une voix ; le consentement, lui, reste indispensable. Les règles sont dans le cadre légal du clonage de voix.
L’abonnement ou le modèle ouvert
0,18 $ la minute avec ElevenLabs Creator, 0,015 $ avec OpenAI, 0,002 $ sur une carte louée. Le calcul est dans une alternative à ElevenLabs sur GPU.
Des sous-titres aux normes
42 caractères par ligne, 17 caractères par seconde, un vérificateur Netflix dans Subtitle Edit, et ffmpeg pour incruster. La chaîne est dans les sous-titres automatiques sans service payant.
Composer une musique
ACE-Step sous MIT pour quatre minutes de chanson en sept secondes, Suno qui limite les téléchargements, Udio qui les supprime. Les modèles et leurs licences sont dans la musique IA open source sur GPU.
Savoir qui parle
WhisperX et pyannote pour séparer les locuteurs, un jeton Hugging Face et une relecture obligatoire. Le pas à pas est dans la diarisation avec WhisperX.
Doubler une vidéo
Transcrire, traduire, revoicer avec sa propre voix et caler : quelques centimes de carte contre 15 $ chez ElevenLabs pour dix minutes en trois langues. La chaîne est dans le doublage IA d’une vidéo.