Québec, Canada

403-1381 1re Avenue

+1 581.849.27.96

bdgouthiere@gmail.com

Faire parler un avatar IA sur un GPU loué : outils ouverts et prix

Ou : comment prêter une voix à un visage sans prêter votre carte bancaire à un abonnement.

La réponse courte : les outils ouverts se rangent en deux familles. Ceux qui font du lipsync sur une vidéo filmée, comme MuseTalk ou LatentSync, ne redessinent que la bouche : ils sont rapides et légers, MuseTalk tourne même sur une carte de 4 Go. Ceux qui animent un portrait à partir d’une photo et d’un fichier son, comme InfiniteTalk, EchoMimicV3, StableAvatar ou Wan2.2-S2V, font bouger tout le visage, parfois le corps, et demandent de 12 à 80 Go de mémoire. Les services clés en main démarrent autour de 29 $ par mois. Sur une RTX 4090 louée, un clip parlant de cinq secondes coûte environ deux centimes de calcul. Avant tout, lisez les licences : c’est le coin de la vidéo générative sur GPU où elles piègent le plus.

Les pièges ont trois formes. La première est la plus franche : Wav2Lip, longtemps la référence, précise dans son dépôt que toute utilisation commerciale est « strictement interdite », parce que ses modèles ont été entraînés sur un jeu de données de recherche ; Sonic, de Tencent, est sous licence Creative Commons non commerciale. La deuxième est géographique : la licence de HunyuanVideo-Avatar ne s’applique pas dans l’Union européenne, au Royaume-Uni ni en Corée du Sud. La troisième est cachée : Hallo, Hallo2 et LivePortrait affichent une licence MIT, mais s’appuient sur les modèles de détection de visage d’InsightFace, réservés à la recherche non commerciale. Le fichier de licence de LivePortrait conseille d’ailleurs de les remplacer pour un usage commercial.

LivePortrait mérite une précision de plus : ce n’est pas un outil de lipsync. Il anime un portrait à partir d’une vidéo de référence, pas d’un fichier audio. Très rapide, une quinzaine de millisecondes par image sur une RTX 4090 selon son dépôt, il sert à transférer une expression, pas à faire parler.

Pour qui : un formateur, un créateur ou une petite équipe qui veut un présentateur virtuel ou doubler ses vidéos, sans abonnement mensuel à un service d’avatars.

À partir de : 0,34 $ de l’heure pour une RTX 4090 de 24 Go en Community Cloud, 0,79 $ pour une L40S de 48 Go, facturés à la seconde.

Pour démarrer : ouvrir un compte Runpod, lancer un pod ComfyUI sur une RTX 4090, puis installer MuseTalk pour une vidéo filmée ou InfiniteTalk pour une photo.

Lipsync et avatars IA open source : les outils, leur licence et leur mémoire

OutilCe qu’il faitLicenceMémoire annoncéeÀ savoir
MuseTalk 1.5lipsync sur une vidéo filméeMIT, poids compristesté sur 4 Goplus de 30 images par seconde sur V100
LatentSync 1.6lipsync sur une vidéo, en 512 pxApache 2.0, poids OpenRAIL++18 Go, 8 Go pour la 1.5restrictions d’usage de la licence OpenRAIL
InfiniteTalkdoublage d’une vidéo ou d’une photo, tête et corpsApache 2.0mode très économe disponibledurée illimitée à partir d’une vidéo
MultiTalkconversation à plusieurs depuis une photoApache 2.048 Go en 480p, 13 Go en mode économejusqu’à 15 secondes
EchoMimicV3portrait animé, 1,3 milliard de paramètresApache 2.012 Gojusqu’à 768 x 768
StableAvatarportrait animé de longue duréeMIT18 Go pour 5 s en 480 x 8323 minutes par clip sur RTX 4090
FantasyTalkingportrait animé depuis une photoApache 2.040 Go, 5 Go en mode économe512 x 512
Wan2.2-S2V-14Bphoto et son vers vidéo cinématiqueApache 2.080 Go sur une seule carte480p et 720p
Wav2Liplipsync sur une vidéousage commercial interditnon publiéerecherche et usage personnel
HunyuanVideo-Avatarportrait animéne s’applique pas dans l’UE24 Go au minimumhors jeu pour une entreprise européenne

Licences et mémoire relevées le 28 septembre 2026 dans les dépôts et fiches officiels.

Le calcul du coût part des rares chiffres publiés. Le dépôt de StableAvatar annonce trois minutes et 18 Go pour un clip de cinq secondes en 480 x 832 sur une RTX 4090. À 0,34 $ de l’heure, cela fait 0,017 $ le clip, soit environ 0,20 $ la minute d’avatar, hors installation et hors essais ratés. MultiTalk publie un tableau plus détaillé, sur A100 : 35 secondes par étape de débruitage en 480p avec 48 Go, 44 secondes en mode économe avec 13 Go. MuseTalk, lui, travaille quasiment en temps réel, puisqu’il ne redessine qu’une zone de 256 pixels autour de la bouche.

En face, les services clés en main facturent l’abonnement. HeyGen propose une offre gratuite limitée à trois vidéos d’une minute par mois, puis Creator à 29 $ par mois, 24 $ en engagement annuel. Synthesia démarre à 29 $ par mois, 18 $ en annuel. D-ID affiche des offres moins chères, mais ne mentionne une licence d’usage commercial qu’à partir de Pro, à 29 $ par mois. Ces services vendent aussi des avatars prêts à l’emploi, un éditeur et des voix ; la carte louée, elle, ne vend que du calcul.

Ma recommandation dépend de ce que vous filmez. Pour doubler une vidéo où vous apparaissez déjà, MuseTalk : licence MIT, poids compris, et une carte modeste suffit. Pour un présentateur à partir d’une photo, InfiniteTalk ou EchoMimicV3 selon la mémoire disponible, tous deux sous Apache 2.0. Wan2.2-S2V donne le rendu le plus cinématique, mais demande une carte de 80 Go. Et quel que soit l’outil, un visage ou une voix qui ne sont pas les vôtres exigent l’accord de la personne.

La marionnette parle, la machine tient les fils : reste à vérifier qui a le droit de vendre le spectacle.

Si l’avatar doit entrer dans une vidéo complète

Voix, clips, musique et sous-titres s’enchaînent avant le montage final. L’ensemble de la chaîne est décrit dans de l’image au montage.

Si votre avatar a un visage réaliste

YouTube demande de déclarer les personnes réalistes qui disent ce qu’elles n’ont pas dit, et refuse de payer certains avatars. Les règles sont dans la monétisation d’une chaîne vidéo IA.

Si vous hésitez entre 24 et 80 Go

La mémoire décide de l’outil autant que la qualité. Le choix de la carte, du 24 Go au 80 Go, est détaillé dans la carte à louer pour la vidéo générative.