# Les voix de synthèse ouvertes qui parlent français sans abonnement

> Qwen3-TTS, Chatterbox, Kyutai, CosyVoice, XTTS, Kokoro, Fish Speech : les voix de synthèse ouvertes en français, leur licence, le clonage et la carte nécessaire.


*Ou : les modèles qui parlent le mieux français ne sont pas toujours ceux qui ont le droit de travailler.*

La réponse courte : pour une voix de synthèse en français que vous pouvez utiliser commercialement, les meilleurs choix ouverts de 2026 sont Qwen3-TTS, d'Alibaba, et Chatterbox multilingue, de Resemble AI : licence Apache 2.0 ou MIT, français pris en charge, clonage d'une voix à partir de quelques secondes. Kyutai, laboratoire parisien, propose deux modèles bilingues sous licence CC-BY. Les noms les plus cités dans les comparatifs, en revanche, sont des pièges : XTTS-v2, Fish Speech et F5-TTS interdisent l'usage commercial de leurs poids, et Kokoro n'a qu'une voix française, de qualité moyenne selon sa propre fiche. C'est le premier choix à faire pour [la transcription et la voix sans abonnement](/guides/gpu-cloud-ia/audio-ia-gpu-cloud/).

Commençons par les pièges, puisqu'ils trônent en tête de tous les tutoriels. XTTS-v2, de Coqui, parle dix-sept langues et clone une voix en six secondes, mais sa licence, la Coqui Public Model License, n'autorise « que l'usage non commercial d'un modèle et de ses résultats ». Le site de Coqui ne répond plus, et son dépôt n'est plus mis à jour depuis août 2024. [Fish Audio S2 Pro](https://huggingface.co/fishaudio/s2-pro), qui parle français, n'accorde aucun droit commercial, y compris pour l'usage interne d'une entreprise. Les poids de F5-TTS sont sous licence non commerciale à cause de leur jeu d'entraînement, Emilia. Même Mistral publie les poids de Voxtral TTS sous licence non commerciale : seule son API est utilisable pour un produit.

Kokoro, lui, est libre, sous Apache 2.0, minuscule avec 82 millions de paramètres, et assez rapide pour tourner sans carte graphique. Mais [sa fiche](https://huggingface.co/hexgrad/Kokoro-82M) est franche : une seule voix française, entraînée sur moins de onze heures d'audio, notée B-, et une prise en charge des langues autres que l'anglais qui « peut être absente ou mince ». Pour une narration en français, il fait l'affaire à petit budget, pas davantage.

> **Pour qui** : un vidéaste, un formateur ou un développeur qui veut une voix de synthèse française, voire la sienne, sans abonnement et avec le droit de s'en servir commercialement.
>
> **À partir de** : 0,34 $ de l'heure pour une RTX 4090 de 24 Go en Community Cloud, 0,74 $ en Secure Cloud, facturés à la seconde.
>
> **Pour démarrer** : ouvrir un compte Runpod, lancer un pod PyTorch sur une RTX 4090, puis installer Qwen3-TTS ou Chatterbox et cloner une voix de test.

## TTS open source français : les modèles, leur licence et ce qu'ils savent faire

| Modèle | Licence des poids | Français | Clonage de voix | Taille ou mémoire | Usage commercial |
|---|---|---|---|---|---|
| Qwen3-TTS 1.7B et 0.6B | Apache 2.0 | oui, parmi 10 langues | oui, à partir de 3 s | 1,9 ou 0,9 milliard de paramètres | oui |
| Chatterbox multilingue | MIT | oui, parmi 23 langues | oui, avec filigrane inaudible | 0,5 milliard | oui |
| CosyVoice 3 | Apache 2.0 | oui, parmi 9 langues | oui, d'une langue à l'autre | 0,5 milliard | oui |
| VoxCPM2 | Apache 2.0 | oui, parmi 30 langues | oui | 8 Go environ | oui |
| Kyutai TTS 1.6B | CC-BY 4.0 | oui, bilingue anglais et français | limité à des voix précalculées | 4 Go | oui, avec attribution |
| Pocket TTS, de Kyutai | CC-BY 4.0 | oui, parmi 6 langues | oui, clonage sans consentement interdit | 100 millions, tourne sur processeur | oui, avec attribution |
| MeloTTS français | MIT | oui | non | 0,2 Go, temps réel sur processeur | oui |
| Kokoro-82M | Apache 2.0 | une seule voix, notée B- | non | 82 millions | oui |
| XTTS-v2 | Coqui Public Model License | oui | oui, en 6 s | 1,9 Go | non |
| Fish Audio S2 Pro | Fish Audio Research License | oui | oui | 4 milliards | non, même en interne |
| F5-TTS | CC-BY-NC | pas dans le modèle de base | oui | 1,4 Go | non |
| Voxtral TTS 4B, poids ouverts | CC-BY-NC 4.0 | oui | par l'API seulement | 4 milliards, 16 Go | non, sauf par l'API payante |

Licences relevées le 28 septembre 2026 sur les fiches et dépôts officiels.

La vitesse n'est pas un problème. VoxCPM2 génère une minute de parole en une vingtaine de secondes sur une RTX 4090, selon sa fiche ; Pocket TTS, de Kyutai, va six fois plus vite que le temps réel sur le processeur d'un ordinateur portable. Sur une carte louée, la voix de synthèse coûte des fractions de centime par minute ; le coût réel est ailleurs, dans le temps passé à choisir la voix et à régler la prononciation des noms propres. Pour la vidéo sur kDrive publiée avec ce site, les seize segments de voix off ont été générés avec Qwen3-TTS dans un carnet Colab gratuit, sans rien louer.

Deux détails de licence méritent l'attention. Chatterbox marque toutes ses sorties d'un filigrane audio inaudible, qui permet d'identifier une voix générée : c'est plutôt une bonne pratique, mais mieux vaut le savoir. Les modèles de Kyutai sont sous CC-BY, qui impose de citer l'auteur, et Pocket TTS s'obtient par un formulaire qui interdit le clonage d'une voix sans le consentement de la personne.

Ma sélection tient en trois lignes. Pour cloner une voix et publier : Qwen3-TTS ou Chatterbox multilingue, sur une RTX 4090. Pour une voix française sans carte graphique : Pocket TTS ou MeloTTS, sur processeur. Pour tout ce qui sera monétisé, jamais XTTS, Fish Speech ni F5-TTS, quelle que soit la qualité de leurs démonstrations.

![Illustration : petit orgue mécanique en laiton aux tuyaux lumineux dans un atelier sombre, certains tuyaux éclairés d'ambre, d'autres éteints dans une lumière bleue froide](/images/tts-open-source-comparatif-orgue.original.webp "Tous les tuyaux sonnent ; seuls ceux qui sont éclairés ont le droit de jouer en public.")

### Si vous comparez avec ElevenLabs

Le prix à la minute d'un abonnement face au coût d'une carte louée, et ce que chaque offre autorise, est dans [voix IA par abonnement ou modèle ouvert](/guides/gpu-cloud-ia/audio-ia-gpu-cloud/voix-ia-abonnement-vs-open-source/).

### Si vous clonez la voix de quelqu'un

Une voix se clone en trois secondes, mais pas sans règles. Le consentement et la loi sont dans [cloner une voix : ce que la loi autorise](/guides/gpu-cloud-ia/audio-ia-gpu-cloud/clonage-voix-cadre-legal-ethique/).

### Si la voix doit parler plusieurs langues

Qwen3-TTS et CosyVoice gardent une voix d'une langue à l'autre. Le doublage complet d'une vidéo est dans [traduire et doubler une vidéo](/guides/gpu-cloud-ia/audio-ia-gpu-cloud/traduction-doublage-ia-video/).


---

Cette page contient des liens d'affiliation. Si tu souscris via ces liens, je peux toucher une commission sans coût supplémentaire pour toi. Mon avis reste indépendant et basé sur mon usage réel des outils que je recommande.


---

**Tarifs :** prix relevés le 28 septembre 2026 sur les sites officiels des fournisseurs, dans la devise qu'ils affichent : dollars américains pour les plateformes américaines, euros hors taxes pour les européennes. Les tarifs du GPU bougent souvent, et sur une place de marché chaque hôte fixe son prix : les montants cités peuvent avoir changé depuis cette date.

