Prijavi grešku / Zahtjev za značajkom

AI Lip Sync Video Generator

Pretvorite fotografiju lica i audio isječak u video govorne glave sa sinkronizacijom usana, poza glave i treperenja. Trenutno nedostupno dok tražimo model čija licenca to dopušta.

Još nemamo TTS glasove na vašem jeziku. Pomozite nam da dodamo vaše! Prodaj svoj glas
Sinkronizacija usana trenutno nije dostupna. SadTalker model koji je koristio je obučen na Basel Face Modelu, koji je licenciran samo za nekomercijalna istraživanja, tako da ga ne možemo ponuditi na plaćenoj usluzi. Još nije instalirana zamjena sa odgovarajućom licencom.

_Učitaj

1000 znakova u sekundi

Povucispusti datoteku ovdje, ili pregledaj

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

datoteka.mp3

0 MB

Povucispusti datoteku ovdje, ili pregledaj

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

datoteka.mp3

0 MB

Obrađujem...

Renderiranje videa. Ovo obično traje 30 sekundi do 2 minute.

Vaš Talking-Head video

Preuzmi

O SadTalkeru

SadTalker (CVPR 2023, Tencent ARC) je model govorne glave otvorenog koda koji animira jednu sliku lica da bi izgovorio bilo koji zvuk.Za razliku od Wav2Lip varijanti, SadTalker također animira pozu glave, trepće i izraz za prirodniji rezultat.

SadTalkerov kod je Apache-2.0, ali su njegove 3D rekonstrukcije lica trenirane na Basel Face Modelu, čija licenca dozvoljava samo nekomercijalna istraživanja. TTS.ai je komercijalna usluga, tako da je alat isključen 15. septembra 2026.

Savjeti za najbolje rezultate

  • Koristite visokokvalitetan, dobro osvijetljen portret - oči su vidljive, usta zatvorena
  • Centrirano lice, kvadrat ili omjer 4:5 najbolje funkcionira
  • Čisti zvuk govora (bez muzike) daje čvršću sinkronizaciju usana
  • Omogući GFPGAN za snimke heroja — udvostručuje vrijeme renderiranja ali izoštrava detalje
  • Koristite prednastavu za mirno kad želite mirno snimanje avatara

Lip Sync Video Plans

Počnite besplatno, nadogradite kada vam treba više

Slobodan
  • 30-sekundino audio ograničenje
  • Izlaz
  • Samo "Still" unaprijed postavljen
  • Nema pojačavanja lica
Najpopularnije
Slobodan račun
  • 30-sekundino audio ograničenje
  • I "full" i "still" unaprijed postavke
  • Izlaz
  • GFPGAN poboljšavač lica
Prijavite se besplatno
Pro
  • 5-minutno audio ograničenje
  • Prioritet GPU reda
  • API pristup (višedijelni upload)
  • Povratni poziv za dovršavanje webhooka
  • Trenutno nedostupno (nekomercijalna licenca modela)
Nadogradi

Često postavljana pitanja

Upload a face photo and an audio clip, and AI generates a video of that face speaking the audio with lips movements, head pose and blinks. The tool is currently not available: it ran SadTalker (CVPR 2023), whose 3D face reconstruction weights were trained on the Basel Face Model, which is licensed for non-commercial research only.

Ulaz lica može biti JPG ili PNG slika (do 10 MB) ili kratak MP4/WebM video vozača (koristimo prvi okvir). Vozački zvuk može biti MP3, WAV, M4A, ili FLAC do 10 MB. Interno ponovno uzorkujemo zvuk na 16 kHz.

Besplatni računi: do 30 sekundi po isječku. Korisnici koji plaćaju: do 5 minuta po zahtjevu. Duži audio znači dulje vrijeme renderiranja i veću cijenu karaktera.

Sinkronizacija usana koristi 1000 znakova u sekundi generiranog videa. 30-sekundini isječak = 30.000 znakova. Trošak se naplaćuje unaprijed iz vašeg stanja znakova i automatski se vraća ako generiranje ne uspije.

Ne. Alat je isključen jer modelna licenca to ne dozvoljava. Kod SadTalkera je Apache-2.0, ali njegova mreža za rekonstrukciju lica je obučena na Basel Face Model 2009, čija licenca dozvoljava samo interna, nekomercijalna istraživanja. Videozapisi generirani njime prije 15. septembra 2026. nisu za komercijalnu upotrebu, uključujući i plaćene planove. Vi ste odgovorni za prava na izvornu sliku lica i zvuk koji učitate.

Kada je alat pokrenut, 5-sekundini isječak je trajao oko 30 sekundi, skalirajući se otprilike linearno sa audio dužinom. Trenutno nije dostupan dok tražimo model govorne glave čija licenca to dopušta.

Potpuna unaprijed postavljena (uobičajena) animacija pomjeranja glave, treperenja i izraza lica zajedno s usnama, stvarajući prirodniji video s govorećim glavama. Nepomična unaprijed postavljena animacija zaključava glavu na mjestu i animira samo usta - korisno kada želite stabilan snimak avatara.

GFPGAN je model za obnavljanje lica koji izoštrava detalje lica nakon renderiranja. Ne nudi se: njegov StyleGAN2 prethodnik je pod NVIDIA nekomercijalnom licencom i njegov model za analizu lica je CC BY-NC-SA.

SadTalker je uobičajeno prikazan na 256 px, sa 512 px kao sporijom opcijom. Alat trenutno nije dostupan; dobro osvijetljen, visoko kvalitetan portret daje najbolji rezultat sa bilo kojim modelom govorne glave.

Da. Učitaj MP4 ili WebM kao ulaz lica i mi ćemo koristiti prvi okvir kao vozački identitet. Za potpuno ponovno sinkroniziranje videa (zamjena usta po kadru), pogledajte nadolazeći video kanal Dubbing Studio.

Da. POST-i višedijelni zahtjev na /api/v1/lipsync/ sa poljima lica i zvuka, zatim upiši /api/v1/lipsync/result/?uuid= dok status ne bude "dovršen". Odgovor sadrži URL do prikazanog MP4-a. API pristup zahtijeva plaćeni plan.

SadTalker koristi poravnavanje lica da otkrije i izreže najistaknutije lice. Za najbolje rezultate, pošaljite portret sa jednom osobom u centru, vidljivim očima i minimalnom okluzijom. Grupne fotografije mogu proizvesti nepredvidljive rezultate.
5.0/5 (1)

Šta možemo da poboljšamo? Vaše povratne informacije nam pomažu da riješimo probleme.

Spreman za početak?

Prijavite se besplatno i dobijte 15.000 znakova, bez kreditne kartice.