Québec, Canada

403-1381 1re Avenue

+1 581.849.27.96

bdgouthiere@gmail.com

Payer la minute ou louer le GPU : le seuil où Whisper devient rentable

Ou : pourquoi la transcription la moins chère n’est pas celle qu’on fait soi-même, sauf quand elle l’est.

La réponse courte : une heure d’audio transcrite coûte de 0,04 $ chez Groq à 0,36 $ avec l’API Whisper d’OpenAI. Sur une RTX 4090 louée et occupée sans pause, le calcul tombe sous le centime. Mais la carte ne gagne que sur les gros volumes traités d’un bloc : installation, démarrage et chargement du modèle se paient à chaque session. Sur le pipeline de ce site, seize courts fichiers transcrits en serverless ont coûté plus cher à la minute d’audio que l’API d’OpenAI. Et les API les plus précises en français font mieux que Whisper. C’est le calcul central de l’audio IA sur GPU loué.

Le prix d’abord, parce que les écarts sont énormes. Groq facture Whisper large-v3 turbo 0,04 $ l’heure d’audio, avec un minimum de dix secondes par requête. Mistral facture sa transcription Voxtral 0,003 $ la minute, soit 0,18 $ l’heure, comme le modèle de transcription économique d’OpenAI. L’API Whisper historique d’OpenAI reste à 0,006 $ la minute. Les spécialistes, Deepgram, AssemblyAI, ElevenLabs, Speechmatics, se situent entre 0,15 et 0,40 $ l’heure, séparation des locuteurs parfois comprise.

La précision ensuite, parce qu’elle renverse une partie du classement. Sur les trois jeux de test français du classement Open ASR de Hugging Face, ElevenLabs Scribe v2 commet 3,3 % d’erreurs de mots en moyenne, AssemblyAI 3,9 %, Voxtral Small 4,1 %, et Whisper large-v3, celui que vous installeriez sur votre carte, 6,2 %. Transcrire soi-même, c’est payer moins pour une transcription un peu moins juste, à relire davantage.

Pour qui : un développeur ou une équipe qui transcrit régulièrement et se demande s’il est temps de faire tourner Whisper soi-même.

À partir de : 0,00031 $ la seconde de RTX 4090 en serverless, soit 1,10 $ de l’heure ; 0,34 $ de l’heure en pod Community Cloud.

Pour démarrer : rester sur une API tant que le volume est faible ; déployer le worker faster-whisper sur Runpod Serverless quand les fichiers longs arrivent par lots.

Whisper API prix vs auto-hébergé : le coût d’une heure d’audio, méthode par méthode

MéthodePrix de l’heure d’audioÀ savoir
Groq, Whisper large-v3 turbo0,04 $minimum de 10 s facturé par requête
Groq, Whisper large-v30,111 $
AssemblyAI Universal-20,15 $locuteurs en option, 0,02 $ de plus
Mistral, Voxtral Mini Transcribe 20,18 $locuteurs et horodatage au mot
OpenAI gpt-4o-mini-transcribe0,18 $
ElevenLabs Scribe v20,22 $le plus précis en français au classement Open ASR
Deepgram Nova-30,26 $locuteurs compris
OpenAI Whisper, whisper-10,36 $
Infomaniak AI Services, Whisper V30,006 CHF la minute de calculfacturé au temps de calcul, pas à la durée de l’audio ; hébergé en Suisse
RTX 4090 en pod, carte occupée sans pausemoins de 0,01 $calcul sur la vitesse publiée de faster-whisper
Runpod Serverless, mesure du siteenviron 0,48 $0,05 $ pour 6 min 12 s d’audio en seize fichiers courts

Prix relevés le 28 septembre 2026 sur les grilles officielles ; les deux dernières lignes sont des calculs.

La ligne du bas mérite une explication, parce qu’elle contredit l’intuition. Pour la vidéo sur kDrive, le site a transcrit seize voix off, 372 secondes d’audio, par le worker faster-whisper de Runpod en serverless, avec le modèle large-v3. La facture : 169 secondes de RTX 4090, 0,05 $, soit environ 0,48 $ par heure d’audio. Chaque worker démarre, charge un modèle de plusieurs gigaoctets, transcrit une vingtaine de secondes de voix, puis reste facturé quelques secondes d’inactivité. Sur des fichiers courts, ce surcoût fixe écrase le reste.

Le seuil se calcule simplement. Une RTX 4090 louée 0,34 $ de l’heure transcrit, en mode par lots, plusieurs dizaines d’heures d’audio par heure de location. Face à l’API Whisper d’OpenAI, elle devient rentable dès que vous lui donnez plus d’une heure d’audio par heure louée ; face à Voxtral, près de deux heures ; face à Groq, plus de huit. Ajoutez une demi-heure d’installation et de réglage à la première session, et un fichier d’une heure ne justifie jamais la location : une archive de cinquante heures, si.

Reste la question des données. Groq, OpenAI et Deepgram sont des sociétés américaines. Mistral propose un point d’accès européen, facturé 10 % de plus, mais sa documentation ne dit pas si Voxtral y est disponible. Infomaniak AI Services héberge son Whisper en Suisse, au temps de calcul, ce qui rend la comparaison directe impossible sans essai. Une carte louée dans un datacenter européen, elle, ne transmet l’audio à personne.

Ma règle : sous une vingtaine d’heures d’audio par mois, une API. Groq pour le prix, Voxtral ou ElevenLabs pour la précision en français, Infomaniak pour l’hébergement suisse. Au-delà, ou pour une archive à traiter d’un bloc, un pod RTX 4090 le temps du lot, puis arrêté. Le serverless n’a de sens que pour des fichiers longs qui arrivent de façon irrégulière.

D'un côté le temps de la carte, de l'autre le prix de la minute : la balance penche selon ce que vous posez dessus.

Si vous choisissez de louer la carte

Le modèle, les réglages et la vitesse de faster-whisper sur une RTX 4090 sont détaillés dans faster-whisper sur GPU loué.

Si vous avez besoin de savoir qui parle

La séparation des locuteurs est incluse chez certains fournisseurs, payante chez d’autres, gratuite mais laborieuse avec WhisperX. Le pas à pas est dans identifier les locuteurs avec WhisperX.

Si la transcription sert à doubler une vidéo

Transcrire n’est que la première étape d’un doublage. La traduction et la voix sont dans traduire et doubler une vidéo.