# Faire parler un avatar IA sur un GPU loué : outils ouverts et prix

> MuseTalk, LatentSync, InfiniteTalk, Wan2.2-S2V : ce que fait chaque outil de lipsync ouvert, sa licence, sa mémoire, et son prix face à HeyGen ou Synthesia.


*Ou : comment prêter une voix à un visage sans prêter votre carte bancaire à un abonnement.*

La réponse courte : les outils ouverts se rangent en deux familles. Ceux qui font du lipsync sur une vidéo filmée, comme MuseTalk ou LatentSync, ne redessinent que la bouche : ils sont rapides et légers, MuseTalk tourne même sur une carte de 4 Go. Ceux qui animent un portrait à partir d'une photo et d'un fichier son, comme InfiniteTalk, EchoMimicV3, StableAvatar ou Wan2.2-S2V, font bouger tout le visage, parfois le corps, et demandent de 12 à 80 Go de mémoire. Les services clés en main démarrent autour de 29 $ par mois. Sur une RTX 4090 louée, un clip parlant de cinq secondes coûte environ deux centimes de calcul. Avant tout, lisez les licences : c'est le coin de [la vidéo générative sur GPU](/guides/gpu-cloud-ia/video-generative-gpu-cloud/) où elles piègent le plus.

Les pièges ont trois formes. La première est la plus franche : [Wav2Lip](https://github.com/Rudrabha/Wav2Lip), longtemps la référence, précise dans son dépôt que toute utilisation commerciale est « strictement interdite », parce que ses modèles ont été entraînés sur un jeu de données de recherche ; Sonic, de Tencent, est sous licence Creative Commons non commerciale. La deuxième est géographique : la licence de HunyuanVideo-Avatar ne s'applique pas dans l'Union européenne, au Royaume-Uni ni en Corée du Sud. La troisième est cachée : Hallo, Hallo2 et LivePortrait affichent une licence MIT, mais s'appuient sur les modèles de détection de visage d'InsightFace, réservés à la recherche non commerciale. Le fichier de licence de LivePortrait conseille d'ailleurs de les remplacer pour un usage commercial.

LivePortrait mérite une précision de plus : ce n'est pas un outil de lipsync. Il anime un portrait à partir d'une vidéo de référence, pas d'un fichier audio. Très rapide, une quinzaine de millisecondes par image sur une RTX 4090 selon son dépôt, il sert à transférer une expression, pas à faire parler.

> **Pour qui** : un formateur, un créateur ou une petite équipe qui veut un présentateur virtuel ou doubler ses vidéos, sans abonnement mensuel à un service d'avatars.
>
> **À partir de** : 0,34 $ de l'heure pour une RTX 4090 de 24 Go en Community Cloud, 0,79 $ pour une L40S de 48 Go, facturés à la seconde.
>
> **Pour démarrer** : ouvrir un compte Runpod, lancer un pod ComfyUI sur une RTX 4090, puis installer MuseTalk pour une vidéo filmée ou InfiniteTalk pour une photo.

## Lipsync et avatars IA open source : les outils, leur licence et leur mémoire

| Outil | Ce qu'il fait | Licence | Mémoire annoncée | À savoir |
|---|---|---|---|---|
| MuseTalk 1.5 | lipsync sur une vidéo filmée | MIT, poids compris | testé sur 4 Go | plus de 30 images par seconde sur V100 |
| LatentSync 1.6 | lipsync sur une vidéo, en 512 px | Apache 2.0, poids OpenRAIL++ | 18 Go, 8 Go pour la 1.5 | restrictions d'usage de la licence OpenRAIL |
| InfiniteTalk | doublage d'une vidéo ou d'une photo, tête et corps | Apache 2.0 | mode très économe disponible | durée illimitée à partir d'une vidéo |
| MultiTalk | conversation à plusieurs depuis une photo | Apache 2.0 | 48 Go en 480p, 13 Go en mode économe | jusqu'à 15 secondes |
| EchoMimicV3 | portrait animé, 1,3 milliard de paramètres | Apache 2.0 | 12 Go | jusqu'à 768 x 768 |
| StableAvatar | portrait animé de longue durée | MIT | 18 Go pour 5 s en 480 x 832 | 3 minutes par clip sur RTX 4090 |
| FantasyTalking | portrait animé depuis une photo | Apache 2.0 | 40 Go, 5 Go en mode économe | 512 x 512 |
| Wan2.2-S2V-14B | photo et son vers vidéo cinématique | Apache 2.0 | 80 Go sur une seule carte | 480p et 720p |
| Wav2Lip | lipsync sur une vidéo | usage commercial interdit | non publiée | recherche et usage personnel |
| HunyuanVideo-Avatar | portrait animé | ne s'applique pas dans l'UE | 24 Go au minimum | hors jeu pour une entreprise européenne |

Licences et mémoire relevées le 28 septembre 2026 dans les dépôts et fiches officiels.

Le calcul du coût part des rares chiffres publiés. [Le dépôt de StableAvatar](https://github.com/Francis-Rings/StableAvatar) annonce trois minutes et 18 Go pour un clip de cinq secondes en 480 x 832 sur une RTX 4090. À 0,34 $ de l'heure, cela fait 0,017 $ le clip, soit environ 0,20 $ la minute d'avatar, hors installation et hors essais ratés. MultiTalk publie un tableau plus détaillé, sur A100 : 35 secondes par étape de débruitage en 480p avec 48 Go, 44 secondes en mode économe avec 13 Go. MuseTalk, lui, travaille quasiment en temps réel, puisqu'il ne redessine qu'une zone de 256 pixels autour de la bouche.

En face, les services clés en main facturent l'abonnement. [HeyGen](https://www.heygen.com/pricing) propose une offre gratuite limitée à trois vidéos d'une minute par mois, puis Creator à 29 $ par mois, 24 $ en engagement annuel. Synthesia démarre à 29 $ par mois, 18 $ en annuel. D-ID affiche des offres moins chères, mais ne mentionne une licence d'usage commercial qu'à partir de Pro, à 29 $ par mois. Ces services vendent aussi des avatars prêts à l'emploi, un éditeur et des voix ; la carte louée, elle, ne vend que du calcul.

Ma recommandation dépend de ce que vous filmez. Pour doubler une vidéo où vous apparaissez déjà, MuseTalk : licence MIT, poids compris, et une carte modeste suffit. Pour un présentateur à partir d'une photo, [InfiniteTalk](https://github.com/MeiGen-AI/InfiniteTalk) ou EchoMimicV3 selon la mémoire disponible, tous deux sous Apache 2.0. Wan2.2-S2V donne le rendu le plus cinématique, mais demande une carte de 80 Go. Et quel que soit l'outil, un visage ou une voix qui ne sont pas les vôtres exigent l'accord de la personne.

![Illustration : marionnette de laiton assise sur un établi sombre, ses fils lumineux d'ambre remontant vers une machine dans l'ombre bleutée de l'atelier](/images/lipsync-avatars-ia-gpu-cloud-marionnette.original.webp "La marionnette parle, la machine tient les fils : reste à vérifier qui a le droit de vendre le spectacle.")

### Si l'avatar doit entrer dans une vidéo complète

Voix, clips, musique et sous-titres s'enchaînent avant le montage final. L'ensemble de la chaîne est décrit dans [de l'image au montage](/guides/gpu-cloud-ia/video-generative-gpu-cloud/pipeline-video-ia-image-au-montage/).

### Si votre avatar a un visage réaliste

YouTube demande de déclarer les personnes réalistes qui disent ce qu'elles n'ont pas dit, et refuse de payer certains avatars. Les règles sont dans [la monétisation d'une chaîne vidéo IA](/guides/gpu-cloud-ia/video-generative-gpu-cloud/video-ia-monetisation-chaine/).

### Si vous hésitez entre 24 et 80 Go

La mémoire décide de l'outil autant que la qualité. Le choix de la carte, du 24 Go au 80 Go, est détaillé dans [la carte à louer pour la vidéo générative](/guides/gpu-cloud-ia/video-generative-gpu-cloud/quel-gpu-video-generative/).


---

Cette page contient des liens d'affiliation. Si tu souscris via ces liens, je peux toucher une commission sans coût supplémentaire pour toi. Mon avis reste indépendant et basé sur mon usage réel des outils que je recommande.


---

**Tarifs :** prix relevés le 28 septembre 2026 sur les sites officiels des fournisseurs, dans la devise qu'ils affichent : dollars américains pour les plateformes américaines, euros hors taxes pour les européennes. Les tarifs du GPU bougent souvent, et sur une place de marché chaque hôte fixe son prix : les montants cités peuvent avoir changé depuis cette date.

