Poročilo o napaki / Zahteva o lastnostih

AI Lip Sync Video Generator

Obrnite obraz sliko in zvočni video v pogovorni glavi z usnovo sinhronizacijo, glavo pozo in miglja. Trenutno ni na voljo, medtem ko iščemo model, katerega licenca to omogoča.

Nimamo še glasov TTS v vašem jeziku. Pomagajte nam dodati svoje! Prodaj svoj glas
Trenutno ni na voljo usnje. SadTalker model je bil izurjen na Basel Face Modelu, ki je licenciran samo za nekomercialne raziskave, zato ga ne moremo ponuditi na plačano storitev. Ni nameščenega nobenega zamenjave z ustrezno licenco.

Pošlji obraz + zvok

1000 znakov na sekundo

Povlecite in spustite datoteko sem ali brskanje

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

file.mp3

0 MB

Povlecite in spustite datoteko sem ali brskanje

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

file.mp3

0 MB

Obdelava...

Snemanje vašega videa. To običajno traja 30 sekund do 2 minuti.

Vaš govorniški-glavi video

Prenesi

O SadTalkerju

SadTalker (CVPR 2023, Tencent ARC) je odprti zvočni govorniški model, ki animira enolično obrazno sliko, da govori kakršen koli zvok. Za razliko od Wav2Lip različic, SadTalker prav tako animira glavo, trepne in izraz za bolj naravni rezultat.

SadTalkerjeva koda je Apač-2.0, vendar so bile njegove 3D uteži rekonstrukcije obraza izurjene na Basel Face Modelu, katerega licenca omogoča samo nekomercialne raziskave. TTS.ai je komercialna storitev, zato je bilo orodje izključeno 15. septembra 2026.

Nasveti za najboljše rezultate

  • Uporabite visokokakovostni, dobro osvetljen portret – oči vidne, usta zaprta
  • Usmerjen obraz, kvadratni ali 4:5 razmerje vidika deluje najbolje
  • Čist govor zvok (brez glasbe) prinaša tesnejše usne sinhronizacije
  • Omogoči GFPGAN za junaške posnetke – dvojno izdeluje čas, vendar oštri podrobnosti
  • Uporabi še vedno prednastavitev, če želite stalni avatar snemanje

Videonačrti za sinhronizacijo lipov

Začnite brezplačno, nadgradnja, ko potrebujete več

Prosto
  • 30-sekundna zvočna omejitev
  • Izhod 256 px
  • Samo "doslej" prednastavitev
  • Nobenega okrepitelja obraza
Najbolj priljubljeno
Brezplačni račun
  • 30-sekundna zvočna omejitev
  • Tako "polni" kot "še vedno" nastavitve
  • 256 / 512 px izhod
  • GFPGAN okrepilec obraza
Prosto se prijavite
Prof.
  • 5-minutna zvočna omejitev
  • Prednostna vrstica GPU
  • Dostop API (večstransko nalaganje)
  • Povratni klici za dokončanje spletne strani
  • Trenutno ni na voljo (nekomercialno dovoljenje za modele)
Nadgradnja

Pogosta vprašanja

Naloži sliko obraza in zvočni klip, in AI ustvari video, ki je ta obraz govori z zvokom z gibanjem ustnic, poziranjem glave in migljanjem. Orodje je trenutno nedostopno: je tekel SadTalker (CVPR 2023), katerega 3D tečaji rekonstrukcije obraza so bili izurjeni na Basel Face Model, ki je licenciran samo za nekomercialne raziskave.

Vnos obraza je lahko JPG ali PNG slika (do 10 MB) ali kratka vožnja MP4/WebM video (koristimo prvi okvir). Vožnja zvoka je lahko MP3, WAV, M4A ali FLAC do 10 MB. Notranji vzorec zvoka prevzemamo na 16 kHz.

Brezplačni računi: do 30 sekund na posnetek. Plačilo uporabnikov: do 5 minut na zahtevo. Dlje avdio pomeni daljši čas izdelave in višje stroške karakterja.

Lip sinhronizacija video uporablja 1.000 znakov na sekundo generiranega videa. 30-sekundni klip = 30.000 znakov. Strošek je plačan vnaprej od vašega karakternega ravnovesja in povrnjen samodejno, če generacija ne uspe.

Ne. Orodje je izključeno, ker to ne omogoča model licence. SadTalker koda je Apače-2.0, vendar je njegova svežena rekonstrukcija obraza omrežje je bilo urejeno na Basel Face modelu 2009, katerega licenca omogoča samo notranje, netrgovske raziskave. Videos, ki so bili pridobljeni z njim pred septembrom 15, 2026 niso za komercialno uporabo, vključene plačene načrte. Vi ste odgovorni za pravico do vira obraza sliko in zvoka, ki ste ga naložili.

Ko je orodje tekel, je 5 sekund klip trajal približno 30 sekund, merjanje približno linearno z zvočno dolžino. Trenutno ni na voljo, medtem ko iščemo pogovorno glavo model, katerega licenca to omogoča.

Polna prednastavitev (privzeto) animira glavo pozo, trepne, in izraz skupaj z ustnicami, ustvarjajo bolj naravno govorno glavo video. Še vedno prednastavljivo zaklene glavo na mestu in animira samo usta – koristno, če želite stalni avatar snemanje.

GFPGAN je model restauracije obraza, ki je naostril podatke obraza po prikazu. Ni ponujen: njegov StyleGAN2 predhodni je pod NVIDIA nekomercialno licenco in njegov obraz razčlenjevanje model je CC BY-NC-SA.

SadTalker, ki je prikazana pri 256 px privzeto, s 512 px kot počasnejša možnost. Orodje trenutno ni na voljo; dobro osvetljen, visokokakovostni portret daje najboljši rezultat z vsakim pogovorno-glavi model.

Da. Naložite MP4 ali WebM kot vhod obraza in bomo uporabili prvi okvir kot vozniško identiteto. Za celoten video ponavljanje (zamenjava ust na okvir), glej prihajajoč Dubbing Studio video cevovod.

Da. POST večdelni zahtevek za /api/v1/lipsync/ z obrazom in zvočnimi polji, nato anketa /api/v1/lipsync/result/?uuid= dokler status ni "dopolnjen". Odgovor vsebuje URL do prevedene MP4. API dostop zahteva plačan načrt.

SadTalker uporablja face-alignment za odkrivanje in pridelovanje najpomembnejšega obraza. Za najboljše rezultate, naložite portret z eno osebo središče, oči vidne, in minimalno okclusion. Skupinske fotografije lahko povzročijo nepredvidljive rezultate.
5.0/5 (1)

Kaj bi lahko izboljšali? Vaša povratna informacija nam pomaga rešiti vprašanja.

Pripravljeni za začetek?

Vpišite se brezplačno in dobite 15.000 znakov.