# Transcrire une heure d'audio en deux minutes sur un GPU loué

> faster-whisper sur une RTX 4090 louée : modèle Whisper pour le français, vitesse, réglages, précision mesurée et coût d'une heure d'audio.


*Ou : comment faire taper une heure de réunion par une carte graphique, pendant que la machine à café finit de couler.*

La réponse courte : faster-whisper, une réimplémentation de Whisper sous licence MIT, transcrit en mode par lots treize minutes d'audio en 17 secondes sur une simple RTX 3070 Ti, selon son dépôt. Par une simple règle de trois, une heure d'audio demande environ 80 secondes de calcul, un peu plus de deux minutes avec le chargement du modèle ; sur une RTX 4090 louée 0,34 $ de l'heure, cela fait moins d'un centime par heure d'audio. Dans faster-whisper, le modèle le plus précis pour le français est large-v3, avec une erreur moyenne de 6,2 % des mots sur les jeux de test publics. C'est le point de départ de [transcrire sans payer la minute](/guides/gpu-cloud-ia/audio-ia-gpu-cloud/).

Whisper est le modèle de reconnaissance vocale d'OpenAI, publié en 2022 avec ses poids. faster-whisper, maintenu par SYSTRAN, le fait tourner sur un moteur d'inférence plus efficace, CTranslate2 : [son dépôt](https://github.com/SYSTRAN/faster-whisper) annonce une transcription jusqu'à quatre fois plus rapide que l'implémentation d'origine, pour la même précision et moins de mémoire. Son mode par lots, qui traite plusieurs morceaux d'audio en parallèle, multiplie encore la vitesse par près de quatre.

Le choix du modèle compte plus que celui de la carte. Le large-v3, 1,54 milliard de paramètres, est le plus précis de la famille. Le turbo, 809 millions de paramètres, va environ huit fois plus vite selon OpenAI et demande 6 Go de mémoire au lieu de 10, mais il n'a pas été entraîné pour la traduction. Les modèles distil-whisper, plus rapides encore, sont étiquetés anglais seulement : à éviter pour le français.

> **Pour qui** : un podcasteur, un vidéaste ou un développeur qui transcrit des heures d'audio en français et veut payer la carte, pas la minute.
>
> **À partir de** : 0,34 $ de l'heure pour une RTX 4090 de 24 Go en Community Cloud, 0,74 $ en Secure Cloud, facturés à la seconde.
>
> **Pour démarrer** : ouvrir un compte Runpod, lancer un pod PyTorch sur une RTX 4090, installer faster-whisper et transcrire un premier fichier avec large-v3 en mode par lots.

## faster-whisper sur GPU cloud : la vitesse, le modèle et le prix d'une heure d'audio

| Implémentation, 13 minutes d'audio, large-v2 | Temps | Mémoire |
|---|---|---|
| Whisper d'origine, 16 bits | 2 min 23 s | 4,7 Go |
| faster-whisper, 16 bits | 1 min 03 s | 4,5 Go |
| faster-whisper par lots de 8, 16 bits | 17 s | 6,1 Go |
| faster-whisper par lots de 8, int8 | 16 s | 4,5 Go |

| Modèle | Paramètres | Licence | Erreur moyenne sur le français |
|---|---|---|---|
| Whisper large-v3 | 1,54 milliard | Apache 2.0 sur Hugging Face | 6,2 % |
| Whisper large-v3 turbo | 809 millions | MIT | 6,7 % |
| Voxtral Mini 3B, de Mistral | 4,7 milliards | Apache 2.0 | 6,0 % |
| Voxtral Small 24B, de Mistral | 24 milliards | Apache 2.0 | 4,1 % |
| distil-whisper large-v3 | 756 millions | MIT | anglais seulement |

Temps tirés du dépôt de faster-whisper, mesurés sur une RTX 3070 Ti de 8 Go ; erreur moyenne calculée sur les trois jeux de test français du classement Open ASR de Hugging Face, relevé le 28 septembre 2026.

[Le classement Open ASR de Hugging Face](https://huggingface.co/spaces/hf-audio/open_asr_leaderboard) mérite un détour, parce qu'il remet Whisper à sa place. Sur le français, les meilleurs modèles ouverts sont désormais ceux de Mistral : Voxtral Small commet 4,1 % d'erreurs en moyenne, contre 6,2 % pour Whisper large-v3. Mais il demande environ 55 Go de mémoire, là où Whisper tient dans 10. Quel que soit le modèle, les noms propres et les sigles restent le point faible, comme l'a montré la vidéo du site ; une liste de termes passée en amorce, ou une relecture, reste nécessaire.

Le site a mesuré la chose sur un cas réel. Pour la vidéo sur kDrive, seize fichiers de voix off, 372 secondes d'audio au total, ont été transcrits en français avec large-v3 et l'horodatage mot par mot, par [le worker faster-whisper officiel de Runpod](https://github.com/runpod-workers/worker-faster_whisper) en serverless sur RTX 4090. Quatre fichiers à la fois, l'ensemble a pris cinq minutes environ et coûté 0,05 $, pour 169 secondes de carte facturées. Les erreurs portaient sur les sigles, corrigées depuis le script écrit. Un test isolé, avec le petit modèle base sur cinq secondes d'audio, a montré le vrai coût des petits fichiers : 9,3 secondes de démarrage à froid pour 2,6 secondes de transcription.

Deux leçons en sortent. La première : sur des fichiers courts, le démarrage et le chargement du modèle coûtent plus que la transcription elle-même, et le serverless perd son avantage. La seconde : le worker officiel de Runpod est figé sur une ancienne version de faster-whisper et ne propose ni le mode par lots ni la séparation des locuteurs ; pour des heures d'audio, un pod où vous installez vous-même la dernière version va plus vite.

Ma configuration recommandée : un pod RTX 4090, faster-whisper en mode par lots, le modèle large-v3 en 16 bits, la langue forcée en français et la détection d'activité vocale activée pour sauter les silences. Pour quelques minutes d'audio par semaine, en revanche, ne louez rien : une API coûte moins cher que le temps d'installation.

![Illustration : machine à écrire ancienne en laiton dont les touches s'enfoncent seules dans un atelier sombre, une feuille vierge éclairée d'ambre sortant du chariot](/images/faster-whisper-gpu-cloud-transcription-machine-a-ecrire.original.webp "Elle tape plus vite que vous ne parlez ; reste à lui apprendre l'orthographe des sigles.")

### Si vous hésitez entre louer la carte et payer la minute

De 0,04 $ à 0,40 $ l'heure d'audio par API, contre moins d'un centime sur une carte occupée : le seuil de rentabilité est dans [Whisper auto-hébergé ou API](/guides/gpu-cloud-ia/audio-ia-gpu-cloud/whisper-auto-heberge-vs-api-transcription/).

### Si plusieurs personnes parlent

Whisper ne dit pas qui parle. La séparation des locuteurs avec WhisperX, pas à pas, est dans [la diarisation avec WhisperX](/guides/gpu-cloud-ia/audio-ia-gpu-cloud/diarisation-locuteurs-whisperx/).

### Si la transcription doit finir en sous-titres

Des segments horodatés aux sous-titres lisibles, il reste le découpage des lignes et le format. La chaîne est dans [des sous-titres automatiques de bout en bout](/guides/gpu-cloud-ia/audio-ia-gpu-cloud/sous-titres-automatiques-pipeline/).


---

Cette page contient des liens d'affiliation. Si tu souscris via ces liens, je peux toucher une commission sans coût supplémentaire pour toi. Mon avis reste indépendant et basé sur mon usage réel des outils que je recommande.


---

**Tarifs :** prix relevés le 28 septembre 2026 sur les sites officiels des fournisseurs, dans la devise qu'ils affichent : dollars américains pour les plateformes américaines, euros hors taxes pour les européennes. Les tarifs du GPU bougent souvent, et sur une place de marché chaque hôte fixe son prix : les montants cités peuvent avoir changé depuis cette date.

