# Voix IA par abonnement ou modèle ouvert : le calcul par minute

> ElevenLabs, OpenAI, Azure, Mistral ou un modèle ouvert sur GPU loué : le prix d'une minute de voix de synthèse, les droits commerciaux et le seuil de rentabilité.


*Ou : combien vaut une minute de voix, selon qu'on loue la cabine ou qu'on paie le comédien à la ligne.*

La réponse courte : une minute de voix de synthèse coûte environ 0,18 $ avec un abonnement ElevenLabs Creator, 0,08 $ par son API, 0,015 $ avec OpenAI ou Azure, et une fraction de centime avec un modèle ouvert sur une RTX 4090 louée. ElevenLabs reste la référence pour la qualité et le choix des voix, mais son offre gratuite n'accorde aucun droit commercial. Un modèle ouvert comme Qwen3-TTS ou Chatterbox devient rentable dès que vous produisez plus de quelques dizaines de minutes par mois, à condition d'accepter de le régler vous-même. C'est le calcul qui décide de [transcrire et synthétiser sans abonnement à la minute](/guides/gpu-cloud-ia/audio-ia-gpu-cloud/).

Pour comparer, il faut une unité commune, et les offres n'en ont pas. ElevenLabs vend des crédits, un par caractère, et convertit lui-même 10 000 crédits en une dizaine de minutes de voix ; c'est cette conversion, environ 1 000 caractères par minute, qui sert au tableau ci-dessous. OpenAI, Google, Azure et Mistral facturent le million de caractères ; les modèles ouverts, eux, se paient au temps de carte.

[La grille d'ElevenLabs](https://elevenlabs.io/pricing) se lit en paliers. L'offre gratuite donne dix minutes par mois, sans licence commerciale. Starter, à 6 $ par mois, en donne trente, avec la licence commerciale et le clonage instantané. Creator, à 22 $, en donne 121 et ajoute le clonage professionnel ; Pro, à 99 $, 600. Au-delà du forfait, la minute supplémentaire coûte de 0,17 à 0,20 $. Par son API, le même moteur coûte 0,08 $ les mille caractères, deux fois moins en version rapide.

> **Pour qui** : un vidéaste, un formateur ou un éditeur de podcasts qui produit des dizaines de minutes de voix par mois et se demande si l'abonnement vaut encore la peine.
>
> **À partir de** : 0,34 $ de l'heure pour une RTX 4090 de 24 Go en Community Cloud, 0,74 $ en Secure Cloud, facturés à la seconde.
>
> **Pour démarrer** : ouvrir un compte Runpod, lancer un pod PyTorch sur une RTX 4090, installer Qwen3-TTS et générer la même minute de texte que sur votre abonnement actuel, pour comparer.

## Alternative à ElevenLabs : le prix d'une minute de voix, abonnement, API et GPU loué

| Service ou méthode | Prix affiché | Prix d'une minute, environ | Usage commercial |
|---|---|---|---|
| ElevenLabs Free | 0 $, 10 minutes par mois | gratuit | non |
| ElevenLabs Starter | 6 $ par mois, 30 minutes | 0,20 $ | oui |
| ElevenLabs Creator | 22 $ par mois, 121 minutes | 0,18 $ | oui |
| ElevenLabs Pro | 99 $ par mois, 600 minutes | 0,165 $ | oui |
| ElevenLabs par API, modèles v2 et v3 | 0,08 $ les 1 000 caractères | 0,08 $ | oui |
| Cartesia Pro | 5 $ par mois, 133 minutes | 0,04 $ | oui |
| Google Chirp 3 HD | 30 $ le million de caractères | 0,03 $ | oui |
| Mistral Voxtral TTS, par API | 0,016 $ les 1 000 caractères | 0,016 $ | oui |
| OpenAI tts-1 | 15 $ le million de caractères | 0,015 $ | oui |
| Azure Neural | 15 $ le million de caractères | 0,015 $ | oui |
| Modèle ouvert sur RTX 4090 louée | 0,34 $ de l'heure | environ 0,002 $ | selon la licence du modèle |
| Modèle ouvert sur Colab gratuit | 0 $ | 0 $ | selon la licence du modèle |

Prix relevés le 28 septembre 2026 ; minute calculée sur la base de 1 000 caractères, la conversion d'ElevenLabs ; la ligne RTX 4090 suppose une génération trois fois plus rapide que le temps réel, la vitesse publiée par VoxCPM2.

Le seuil se calcule vite. Une RTX 4090 louée 0,34 $ de l'heure produit, à la vitesse publiée par VoxCPM2, environ trois heures de parole par heure de location. Face à l'abonnement Creator d'ElevenLabs, 22 $ pour 121 minutes, une heure de carte suffit à produire le même volume pour trente-quatre centimes. Même en comptant une heure d'installation et de réglage, la carte louée gagne dès le premier mois pour qui produit ce volume. Face à OpenAI ou Azure, à 0,015 $ la minute, l'écart se resserre : il faut produire plusieurs heures de voix par mois pour que l'installation vaille la peine.

La qualité, elle, ne se met pas dans un tableau. ElevenLabs offre une bibliothèque de voix, un clonage professionnel et un éditeur, qu'un modèle ouvert ne remplace pas en une soirée. Les modèles ouverts utilisables commercialement en français, Qwen3-TTS, Chatterbox multilingue, CosyVoice 3 ou VoxCPM2, clonent une voix en quelques secondes et suffisent pour une narration. Les meilleurs en démonstration, XTTS-v2 ou Fish Speech, sont justement ceux dont la licence interdit l'usage commercial.

La voie du milieu existe : une API à moins de deux centimes la minute, comme OpenAI, Azure ou [Voxtral TTS de Mistral](https://mistral.ai/news/voxtral-tts/), sans rien installer. Pour la vidéo sur kDrive publiée avec ce site, la voix off est passée par Qwen3-TTS dans un carnet Colab gratuit : zéro dollar, au prix de quelques manipulations de fichiers.

Ma règle : l'offre gratuite d'ElevenLabs pour essayer, jamais pour publier. Un abonnement si la qualité de la voix est votre produit, comme pour un livre audio. Une API à la minute pour quelques dizaines de minutes par mois. Et un modèle ouvert sur carte louée, ou sur Colab, dès que vous produisez des heures de voix et que vous pouvez passer une soirée à le régler.

![Illustration : cabine d'enregistrement vitrée plongée dans l'ombre, un micro ancien en laiton éclairé d'ambre au centre, la console de mixage dans une lumière bleue froide](/images/voix-ia-abonnement-vs-open-source-cabine.original.webp "La cabine se loue à l'heure, le comédien se paie à la ligne ; la voix de synthèse brouille la frontière.")

### Si vous choisissez le modèle ouvert

Licences, français, clonage et mémoire de chaque modèle sont comparés dans [les voix de synthèse ouvertes en français](/guides/gpu-cloud-ia/audio-ia-gpu-cloud/tts-open-source-comparatif/).

### Si la voix clonée n'est pas la vôtre

L'abonnement comme le modèle ouvert vous laissent cloner n'importe quelle voix ; la loi, non. Les règles sont dans [le cadre légal du clonage de voix](/guides/gpu-cloud-ia/audio-ia-gpu-cloud/clonage-voix-cadre-legal-ethique/).

### Si vous doublez vos vidéos

Le doublage ajoute la traduction et le calage sur l'image, et ses prix à la minute sont plus élevés. Le calcul est dans [doubler une vidéo en trois langues](/guides/gpu-cloud-ia/audio-ia-gpu-cloud/traduction-doublage-ia-video/).


---

Cette page contient des liens d'affiliation. Si tu souscris via ces liens, je peux toucher une commission sans coût supplémentaire pour toi. Mon avis reste indépendant et basé sur mon usage réel des outils que je recommande.


---

**Tarifs :** prix relevés le 28 septembre 2026 sur les sites officiels des fournisseurs, dans la devise qu'ils affichent : dollars américains pour les plateformes américaines, euros hors taxes pour les européennes. Les tarifs du GPU bougent souvent, et sur une place de marché chaque hôte fixe son prix : les montants cités peuvent avoir changé depuis cette date.

