Signaler la demande de bogue/caractère

Générateur de vidéo AI Lip Sync

Transformez une photo du visage et un clip audio en une vidéo en tête-à-tête parlante avec synchronisation des lèvres, pose de la tête et cligne des yeux. Actuellement indisponible pendant que nous recherchons un modèle dont la licence le permet.

La synchronisation des lèvres n'est pas disponible en ce moment. Le modèle SadTalker utilisé a été formé sur le modèle Basel Face, qui est autorisé pour la recherche non commerciale seulement, donc nous ne pouvons pas l'offrir sur un service payant. Aucun remplacement avec une licence appropriée n'est encore installé.

Télécharger Face + Audio

1 000 caractères par seconde

Faites glisser et déposez votre fichier ici, ou parcourir

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

fichier.mp3

0 MB

Faites glisser et déposez votre fichier ici, ou parcourir

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

fichier.mp3

0 MB

Traitement...

Rendu votre vidéo. Cela prend généralement 30 secondes à 2 minutes.

Votre vidéo en tête de conversation

Télécharger MP4

À propos de SadTalker

SadTalker (CVPR 2023, Tencent ARC) est un modèle de tête parlante open source qui anime une seule image de visage pour parler n'importe quel son. Contrairement aux variantes Wav2Lip, SadTalker anime également la pose de tête, les clignements et l'expression pour un résultat plus naturel.

Le code de SadTalker est Apache-2.0, mais ses poids de reconstruction du visage 3D ont été formés sur le modèle Basel Face, dont la licence permet la recherche non commerciale seulement. TTS.ai est un service commercial, donc l'outil a été éteint le 15 septembre 2026.

Conseils pour les meilleurs résultats

  • Utilisez un portrait de haute qualité, bien éclairé — yeux visibles, bouche fermée
  • Face centrée, carré ou 4:5 le rapport d'aspect fonctionne mieux
  • Le son de la parole propre (pas de musique) donne une synchronisation des lèvres plus serrée
  • Activer GFPGAN pour les coups de héros — double rend le temps mais affûte les détails
  • Utilisez le Toujours préréglé lorsque vous voulez un tir d'avatar stable

Plans vidéo Lip Sync

Commencez gratuitement, mise à niveau lorsque vous avez besoin de plus

Gratuit
  • Limite audio de 30 secondes
  • Sortie 256 px
  • Préréglage "Still" uniquement
  • Pas de rehausseur de visage
Les plus populaires
Compte gratuit
  • Limite audio de 30 secondes
  • Préréglages "plein" et "toujours"
  • Sortie 256 / 512 px
  • Enrichisseur du visage GFPGAN
Inscription gratuite
Pour
  • Limite sonore de 5 minutes
  • file d'attente GPU prioritaire
  • Accès à l'API (téléchargement en plusieurs parties)
  • Callbacks d'achèvement de Webhook
  • Actuellement indisponible (licence modèle non commerciale)
Mise à jour

Foire aux questions

Télécharger une photo du visage et un clip audio, et l'IA génère une vidéo de ce visage parlant l'audio avec des mouvements de lèvres, pose de tête et clignements. L'outil est actuellement indisponible : il a lancé SadTalker (CVPR 2023), dont les poids de reconstruction du visage 3D ont été formés sur le modèle face de Bâle, qui est autorisé pour la recherche non commerciale seulement.

L'entrée du visage peut être une image JPG ou PNG (jusqu'à 10 Mo) ou une courte vidéo de conduite MP4/WebM (nous utilisons la première image). L'audio de conduite peut être MP3, WAV, M4A ou FLAC jusqu'à 10 Mo. Nous rééchantillonnons l'audio à 16 kHz en interne.

Comptes gratuits: jusqu'à 30 secondes par clip. Payer les utilisateurs: jusqu'à 5 minutes par demande.

La vidéo Lip Sync utilise 1 000 caractères par seconde de la vidéo générée. Un clip de 30 secondes = 30 000 caractères. Le coût est facturé à partir de votre solde de caractères et remboursé automatiquement si la génération échoue.

Non. L'outil est désactivé parce que la licence modèle ne l'autorise pas. Le code SadTalker est Apache-2.0, mais son réseau de reconstruction de visage groupé a été formé sur le Basel Face Model 2009, dont la licence permet des recherches internes et non commerciales seulement. Les vidéos générées avec lui avant le 15 septembre 2026 ne sont pas pour une utilisation commerciale, des plans payés inclus. Vous êtes responsable d'avoir les droits sur l'image de visage source et l'audio que vous téléchargez.

Lorsque l'outil a fonctionné, un clip de 5 secondes a pris environ 30 secondes, en s'étalant à peu près linéairement avec la longueur audio. Il est actuellement indisponible pendant que nous recherchons un modèle de tête-à-tête parlante dont la licence le permet.

Complete preset (default) anime la tête pose, clignote, et l'expression avec les lèvres, produisant une vidéo plus naturelle de la tête parlante. Toujours préset verrouille la tête en place et anime seulement la bouche — utile quand vous voulez un coup d'avatar stable.

GFPGAN est un modèle de restauration du visage qui a aiguisé les détails du visage après le rendu. Il n'est pas offert: son StyleGAN2 précédent est sous une licence non commerciale NVIDIA et son modèle d'analyse du visage est CC BY-NC-SA.

SadTalker rendu à 256 px par défaut, avec 512 px comme option plus lente. L'outil est actuellement indisponible; un portrait bien éclairé et de haute qualité donne le meilleur résultat avec n'importe quel modèle de tête-à-tête parlante.

Oui. Télécharger un MP4 ou WebM comme entrée de visage et nous utiliserons la première image comme identité de conduite. Pour le re-doublage vidéo complet (remplacement de bouche par image), voir le pipeline vidéo de Doubling Studio à venir.

Yes. POST a multipart request to /api/v1/lipsync/ with face and audio fields, then poll /api/v1/lipsync/result/?uuid= until status is "completed". The response contains a URL to the rendered MP4. API access requires a paid plan.

SadTalker utilise l'alignement du visage pour détecter et recouvrir le visage le plus proéminent. Pour de meilleurs résultats, téléchargez un portrait avec une personne centrée, les yeux visibles, et l'occlusion minimale.
5.0/5 (1)

Que pourrions-nous améliorer? Vos commentaires nous aident à résoudre les problèmes.

Prêt à commencer?

Inscrivez-vous gratuitement et obtenez 50 crédits. Aucune carte de crédit requise.