Payer la minute ou louer le GPU : le seuil où Whisper devient rentable
Ou : pourquoi la transcription la moins chère n’est pas celle qu’on fait soi-même, sauf quand elle l’est.
La réponse courte : une heure d’audio transcrite coûte de 0,04 $ chez Groq à 0,36 $ avec l’API Whisper d’OpenAI. Sur une RTX 4090 louée et occupée sans pause, le calcul tombe sous le centime. Mais la carte ne gagne que sur les gros volumes traités d’un bloc : installation, démarrage et chargement du modèle se paient à chaque session. Sur le pipeline de ce site, seize courts fichiers transcrits en serverless ont coûté plus cher à la minute d’audio que l’API d’OpenAI. Et les API les plus précises en français font mieux que Whisper. C’est le calcul central de l’audio IA sur GPU loué.
Le prix d’abord, parce que les écarts sont énormes. Groq facture Whisper large-v3 turbo 0,04 $ l’heure d’audio, avec un minimum de dix secondes par requête. Mistral facture sa transcription Voxtral 0,003 $ la minute, soit 0,18 $ l’heure, comme le modèle de transcription économique d’OpenAI. L’API Whisper historique d’OpenAI reste à 0,006 $ la minute. Les spécialistes, Deepgram, AssemblyAI, ElevenLabs, Speechmatics, se situent entre 0,15 et 0,40 $ l’heure, séparation des locuteurs parfois comprise.
La précision ensuite, parce qu’elle renverse une partie du classement. Sur les trois jeux de test français du classement Open ASR de Hugging Face, ElevenLabs Scribe v2 commet 3,3 % d’erreurs de mots en moyenne, AssemblyAI 3,9 %, Voxtral Small 4,1 %, et Whisper large-v3, celui que vous installeriez sur votre carte, 6,2 %. Transcrire soi-même, c’est payer moins pour une transcription un peu moins juste, à relire davantage.
Pour qui : un développeur ou une équipe qui transcrit régulièrement et se demande s’il est temps de faire tourner Whisper soi-même.
À partir de : 0,00031 $ la seconde de RTX 4090 en serverless, soit 1,10 $ de l’heure ; 0,34 $ de l’heure en pod Community Cloud.
Pour démarrer : rester sur une API tant que le volume est faible ; déployer le worker faster-whisper sur Runpod Serverless quand les fichiers longs arrivent par lots.
Whisper API prix vs auto-hébergé : le coût d’une heure d’audio, méthode par méthode
| Méthode | Prix de l’heure d’audio | À savoir |
|---|---|---|
| Groq, Whisper large-v3 turbo | 0,04 $ | minimum de 10 s facturé par requête |
| Groq, Whisper large-v3 | 0,111 $ | |
| AssemblyAI Universal-2 | 0,15 $ | locuteurs en option, 0,02 $ de plus |
| Mistral, Voxtral Mini Transcribe 2 | 0,18 $ | locuteurs et horodatage au mot |
| OpenAI gpt-4o-mini-transcribe | 0,18 $ | |
| ElevenLabs Scribe v2 | 0,22 $ | le plus précis en français au classement Open ASR |
| Deepgram Nova-3 | 0,26 $ | locuteurs compris |
| OpenAI Whisper, whisper-1 | 0,36 $ | |
| Infomaniak AI Services, Whisper V3 | 0,006 CHF la minute de calcul | facturé au temps de calcul, pas à la durée de l’audio ; hébergé en Suisse |
| RTX 4090 en pod, carte occupée sans pause | moins de 0,01 $ | calcul sur la vitesse publiée de faster-whisper |
| Runpod Serverless, mesure du site | environ 0,48 $ | 0,05 $ pour 6 min 12 s d’audio en seize fichiers courts |
Prix relevés le 28 septembre 2026 sur les grilles officielles ; les deux dernières lignes sont des calculs.
La ligne du bas mérite une explication, parce qu’elle contredit l’intuition. Pour la vidéo sur kDrive, le site a transcrit seize voix off, 372 secondes d’audio, par le worker faster-whisper de Runpod en serverless, avec le modèle large-v3. La facture : 169 secondes de RTX 4090, 0,05 $, soit environ 0,48 $ par heure d’audio. Chaque worker démarre, charge un modèle de plusieurs gigaoctets, transcrit une vingtaine de secondes de voix, puis reste facturé quelques secondes d’inactivité. Sur des fichiers courts, ce surcoût fixe écrase le reste.
Le seuil se calcule simplement. Une RTX 4090 louée 0,34 $ de l’heure transcrit, en mode par lots, plusieurs dizaines d’heures d’audio par heure de location. Face à l’API Whisper d’OpenAI, elle devient rentable dès que vous lui donnez plus d’une heure d’audio par heure louée ; face à Voxtral, près de deux heures ; face à Groq, plus de huit. Ajoutez une demi-heure d’installation et de réglage à la première session, et un fichier d’une heure ne justifie jamais la location : une archive de cinquante heures, si.
Reste la question des données. Groq, OpenAI et Deepgram sont des sociétés américaines. Mistral propose un point d’accès européen, facturé 10 % de plus, mais sa documentation ne dit pas si Voxtral y est disponible. Infomaniak AI Services héberge son Whisper en Suisse, au temps de calcul, ce qui rend la comparaison directe impossible sans essai. Une carte louée dans un datacenter européen, elle, ne transmet l’audio à personne.
Ma règle : sous une vingtaine d’heures d’audio par mois, une API. Groq pour le prix, Voxtral ou ElevenLabs pour la précision en français, Infomaniak pour l’hébergement suisse. Au-delà, ou pour une archive à traiter d’un bloc, un pod RTX 4090 le temps du lot, puis arrêté. Le serverless n’a de sens que pour des fichiers longs qui arrivent de façon irrégulière.
Si vous choisissez de louer la carte
Le modèle, les réglages et la vitesse de faster-whisper sur une RTX 4090 sont détaillés dans faster-whisper sur GPU loué.
Si vous avez besoin de savoir qui parle
La séparation des locuteurs est incluse chez certains fournisseurs, payante chez d’autres, gratuite mais laborieuse avec WhisperX. Le pas à pas est dans identifier les locuteurs avec WhisperX.
Si la transcription sert à doubler une vidéo
Transcrire n’est que la première étape d’un doublage. La traduction et la voix sont dans traduire et doubler une vidéo.