Composer une musique libre de droits sur un GPU loué
Ou : comment obtenir une chanson de quatre minutes pour un dixième de centime, et pourquoi personne ne pourra vous la voler, ni vous la protéger.
La réponse courte : le modèle de musique ouvert le plus utile en 2026 s’appelle ACE-Step. Sa version 1.5, sous licence MIT, autorise explicitement l’usage commercial des morceaux, génère une chanson avec paroles en quelques secondes et tient dans moins de 4 Go de mémoire. Sur une RTX 4090 louée, un morceau coûte environ un dixième de centime de calcul. Les services grand public imposent des conditions plus serrées : chez Suno, seuls les morceaux téléchargés depuis une offre payante peuvent être exploités, et Udio n’autorise plus aucun téléchargement. Mais « libre de droits » a un revers : aux États-Unis, une musique entièrement générée n’est pas protégée par le droit d’auteur. C’est le volet musical de l’audio IA sur GPU loué.
ACE-Step est né en avril 2025, d’ACE Studio et de StepFun. Sa première version, sous Apache 2.0, génère jusqu’à quatre minutes de chant avec paroles dans dix-neuf langues, dont le français, et va 34 fois plus vite que le temps réel sur une RTX 4090 : quatre minutes de musique en sept secondes. La version 1.5, sortie en janvier 2026 sous licence MIT, pousse la durée jusqu’à dix minutes, revendique plus de cinquante langues et descend sous les 4 Go de mémoire. Sa fiche précise que les morceaux générés peuvent servir « à des fins commerciales » et que les données d’entraînement sont sous licence, libres de droits ou synthétiques.
Les autres modèles demandent de lire la licence avant la partition. YuE, de l’université des sciences et technologies de Hong Kong et du collectif M-A-P, est sous Apache 2.0 dans sa première version, mais ne chante pas en français ; sa version 2 réserve ses poids aux créateurs individuels, pas aux entreprises. DiffRhythm s’appuie, dans ses premières versions, sur un encodeur audio de Stability soumis à un plafond d’un million de dollars de revenus. MusicGen, de Meta, est non commercial et ne fait que de l’instrumental de trente secondes. SongGeneration, de Tencent, est réservé à la recherche, et ses dépôts officiels sont devenus inaccessibles.
Pour qui : un vidéaste, un podcasteur ou un créateur qui veut des musiques de fond ou des chansons pour ses projets, sans abonnement et avec le droit de les publier.
À partir de : 0,34 $ de l’heure pour une RTX 4090 de 24 Go en Community Cloud, 0,74 $ en Secure Cloud, facturés à la seconde.
Pour démarrer : ouvrir un compte Runpod, lancer un pod PyTorch sur une RTX 4090, installer ACE-Step 1.5 et générer un premier morceau à partir de quelques étiquettes de style.
Musique IA open source sur GPU : les modèles, leur licence et leur coût
| Modèle | Licence des poids | Chant | Durée maximale | Mémoire | Usage commercial des morceaux |
|---|---|---|---|---|---|
| ACE-Step 1.5 | MIT | oui, plus de 50 langues | 10 minutes | moins de 4 Go | oui, écrit dans la fiche |
| ACE-Step v1 | Apache 2.0 | oui, 19 langues dont le français | 4 minutes | 8 Go avec déchargement | oui |
| HeartMuLa 3B | Apache 2.0 | oui | 4 minutes | non publiée | pas de restriction indiquée |
| DiffRhythm 2 | Apache 2.0 | oui, anglais et chinois | non publiée | non publiée | pas de restriction indiquée |
| YuE2 3B | CC BY-NC, avec permission pour les créateurs individuels | oui, anglais et chinois | environ 3 min 30 dans les exemples | 24 Go recommandés | pour un particulier, pas pour une entreprise |
| Stable Audio Open 1.0 | Stability Community License | non, échantillons et effets | 47 secondes | non publiée | gratuit sous 1 M$ de revenus, avec inscription |
| MusicGen | CC-BY-NC 4.0 | non, instrumental | 30 secondes | 16 Go pour le modèle moyen | non |
| SongGeneration, de Tencent | licence de recherche | oui | 4 min 30 | 12 à 28 Go | non, recherche et enseignement seulement |
| Service | Prix | Ce que vous pouvez faire des morceaux |
|---|---|---|
| Suno Free | 0 $ | usage personnel et non commercial, pas de téléchargement |
| Suno Pro | 10 $ par mois, 20 téléchargements | exploitation commerciale des morceaux téléchargés |
| Suno Premier | 30 $ par mois, 60 téléchargements | idem, plus Suno Studio |
| Udio | de 0 à 30 $ par mois | usage personnel et non commercial, aucun téléchargement |
| Stable Audio | à partir de 12 $ par mois | droits cédés selon les conditions de Stability |
Licences et prix relevés le 28 septembre 2026 sur les fiches, dépôts et pages officiels.
Côté coût, la carte louée écrase tout. Quatre minutes en sept secondes sur une RTX 4090 à 0,34 $ de l’heure, cela fait un dixième de centime le morceau, sans compter le démarrage du pod. Même en générant cinquante variantes pour en garder une, la musique d’une vidéo coûte moins que le café du matin. Pour la vidéo sur kDrive publiée avec ce site, les morceaux sont sortis d’ACE-Step dans un carnet Colab gratuit, sur une carte L4, avec une durée de quatre minutes au plus par morceau : zéro dollar.
Le vrai sujet est juridique. Le Bureau du droit d’auteur des États-Unis a tranché dans son rapport de janvier 2025 : le droit d’auteur « ne s’étend pas au matériel entièrement généré par l’IA », et un prompt seul ne donne pas un contrôle suffisant. Une musique sortie d’ACE-Step est donc libre d’usage pour vous, mais n’importe qui peut la reprendre, et YouTube refuse d’enregistrer dans Content ID les contenus qui ne relèvent pas de droits exclusifs. Si vous comptez distribuer vos morceaux, DistroKid les accepte, à condition d’en détenir tous les droits et de déclarer la part générée par l’IA ; sur YouTube, une musique générée réaliste doit être signalée comme contenu IA.
Ma recommandation : ACE-Step 1.5 sur une RTX 4090, ou sur Colab pour quelques morceaux, pour toute musique de fond ou chanson destinée à une vidéo ou un podcast. Suno Pro si vous voulez l’interface et acceptez le quota de téléchargements. Et pour une œuvre que vous voulez protéger, votre propre travail de composition ou d’arrangement par-dessus la génération, qui seul peut fonder un droit d’auteur.
Si la musique accompagne une voix off
Voix de synthèse et musique se produisent avec les mêmes outils ouverts. Les modèles de voix en français sont comparés dans les voix de synthèse ouvertes.
Si vous voulez imiter la voix d’un chanteur
Une chanson générée « à la manière de » est une chose, une voix clonée d’artiste en est une autre. Les règles sont dans cloner une voix, ce que la loi autorise.
Si vous comparez les abonnements audio
Voix, musique, doublage : les abonnements se ressemblent et se paient à la minute. Le calcul pour la voix est dans voix IA par abonnement ou modèle ouvert.