Generator video de sincronizare a lipilor AI

Transformă o fotografie cu fața și un clip audio într-un video cu funcție de țeavă cu sync buze, poziție cap și clipuri. În prezent nu este disponibil în timp ce căutăm un model a cărui licență îi permite.

Lip sync nu este disponibil acum. Modelul SadTalker pe care l-a folosit a fost instruit pe Modelul de Face de Basilea, care este licențiat pentru cercetare necomercială numai, astfel încât nu putem oferi pe un serviciu plătit. Nu înlocuirea cu o licență adecvată este încă instalat.

Încarcă faceta + audio

1000 de caractere pe secundă

Aruncă și aruncă fișierul aici, sau navigați

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

file.mp3

0 MB

Aruncă și aruncă fișierul aici, sau navigați

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

file.mp3

0 MB

Prelucrarea...

Acest lucru durează de obicei 30 de secunde până la 2 minute.

Video-ul tău care vorbeşte

Descarcă MP4

Despre SadTalker

SadTalker (CVPR 2023, Tencent ARC) este un model de conversație open-source care anima o singură imagine față pentru a vorbi orice audio. Spre deosebire de variantele Wav2Lip, SadTalker, de asemenea, anima poziția capului, clipiește și expresia pentru un rezultat mai natural.

Codul lui SadTalker este Apache-2.0, dar greutatea 3D de reconstrucție a feței a fost instruită pe modelul de Basilea Face, al cărui licență permite doar cercetare necomercială. TTS.ai este un serviciu comercial, astfel încât instrumentul a fost oprit pe 15 septembrie 2026.

Sfaturi pentru cele mai bune rezultate

  • Foloseşte un portret de înaltă calitate, bine luminat — ochii vizibile, gura închisă
  • Fața centrată, raportul de aspect pătrat sau 4:5 funcționează cel mai bine
  • Curățați audio de vorbire (nu muzica) produce o sincronizare mai strânsă a buzelor
  • Activează GFPGAN pentru focuri de eroi – dubluri rand timp, dar ascuți detalii
  • Folosește Preconfigurarea încă atunci când doriți o împușcare stabilă de avatar

Planuri video de sincronizare a lipilor

Pornește gratuit, upgrade atunci când aveți nevoie de mai mult

Gratuit
  • Limite audio de 30 de secunde
  • Ieșire 256 px
  • Numai predefinirea "Still"
  • Nici un amplificator de fată
Cel mai popular
Cont liber
  • Limite audio de 30 de secunde
  • Atât "full" cât și "inca" preconizate
  • 256 / 512 ieșire px
  • Îmbunătățitor de fața GFPGAN
Inscrie-te gratis
Pro
  • Limite audio de 5 minute
  • Coada GPU prioritară
  • Acces API (multipart încărcare)
  • Webhook apelback-uri de finalizare
  • În prezent nu este disponibile (model necomercial licență)
Actualizează

Întrebări frecvente

Încărcaţi o fotografie cu fată şi un clip audio, iar AI generează un video cu faţa care vorbeşte audio cu mişcări de buze, poziţie cap şi clipuri. Strumentul este indisponibil în prezent: a rulat SadTalker (CVPR 2023), a cărei greutate de reconstrucţie a face 3D au fost instruite pe modelul Basilea Face, care este licenţiat pentru cercetarea necomercială.

Introducerea feței poate fi o imagine JPG sau PNG (până la 10 MB) sau un scurt video de conducere MP4/WebM (folosim primul cadru). Audio de conducere poate fi MP3, WAV, M4A sau FLAC până la 10 MB. Refigurăm audio la 16 kHz intern.

Conturi gratuite: până la 30 de secunde pe clip. Utilizatori plătitori: până la 5 minute pe cerere. Audio înseamnă mai mult timp și mai mare cost de caracter.

Lip sync video folosește 1000 de caractere pe secundă din video generat. Un clip de 30 de secunde = 30.000 de caractere. Costul este facturat în fața echilibrului de caracter și restituirea automată dacă generația eșuează.

Nu. Uneltul este oprit deoarece licența modelului nu-l permite. Codul SadTalker este Apache-2.0, dar rețeaua de reconstrucție fața în bunuri a fost instruită pe modelul Basel Face 2009, a cărui licență permite doar cercetare internă, necomercială. Video-urile generate cu el înainte de 15 septembrie 2026 nu sunt de utilizare comercială, planuri plătite incluse. Sunteți responsabili pentru a avea drepturile la imaginea feței sursă și audio pe care îl încărcaţi.

Când uneltele au rulat, un clip de 5 secunde a durat aproximativ 30 de secunde, a scară în mod linii de lungime audio. Este in prezent indisponibil în timp ce caută un model de conversație-head a cărui licență îi permite.

Preset complet (default) anima poziția capului, clipiește și expresie împreună cu buzele, producând un video mai natural-cap de conversație. Totuși presetează încuie capul în loc și animează doar gura - util atunci când doriți un foc de avatar stabil.

GFPGAN este un model de restaurare a feței care ascuțit detalii faciale după renderizarea. Nu este oferit: StyleGAN2 anterioar este sub o licență NVIDIA non-commercial și modelul său de analiză feței este CC BY-NC-SA.

SadTalker redat la 256 px prin predefinire, cu 512 px ca o opțiune mai lentă. Uneltul este indisponibil în prezent; un portrait de înaltă calitate, bine luminat, oferă cel mai bun rezultat cu orice model de conversație.

Da. Încarcă un MP4 sau WebM ca intrare în fața și vom folosi primul cadru ca identitate de conducere. Pentru re-dubbing video complet (per-frame gura înlocuitor), a se vedea următoarea conducte video Dubbing Studio.

Yes. POST a multipart request to /api/v1/lipsync/ with face and audio fields, then poll /api/v1/lipsync/result/?uuid= until status is "completed". The response contains a URL to the rendered MP4. API access requires a paid plan.

SadTalker foloseşte alinierea faţălui pentru a detecta şi cultiva faţa cea mai proeminentă. Pentru cele mai bune rezultate, încarcă un portret cu o persoană centrată, ochii vizibile şi ocludere minimă. Fotografiile grupului pot produce rezultate imprevizibile.
5.0/5 (1)

Feedback-ul vostru ne ajută să rezolvăm problemele.

Gata pentru a începe?

Inscrie-te gratis si primeste 15.000 de personaje. Nu este nevoie de card de credit.