Al Lip Sync Video Generator

Otočte fotku obličeje a audio klip do mluveného videa s synchronizací rtů, pózu hlavy a mrkne. V současné době není k dispozici, zatímco hledáme model, jehož licence to umožňuje.

Synchronizace rtů není k dispozici právě teď. Model SadTalker, který používal, byl vyškolen na Basel Face Model, který je licencovaný pouze pro nekomerční výzkum, takže ho nemůžeme nabídnout na placené služby. Žádná náhrada s vhodnou licencí ještě není nainstalován.

Odeslat obličej + Audio

1000 znaků za sekundu

Přetáhněte váš soubor sem, nebo Procházet

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

soubor.mp3

0 MB

Přetáhněte váš soubor sem, nebo Procházet

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

soubor.mp3

0 MB

Zpracovávám...

Tohle obvykle trvá 30 sekund až 2 minuty.

Vaše mluvící-hlava video

Stáhnout MP4

O SadTalkerovi

SadTalker (CVPR 2023, Tencent ARC) je open-source mluvící-hlava model, který animuje jeden obrázek obličeje mluvit jakýkoli zvuk. Na rozdíl od variant Wav2Lip, SadTalker také animuje hlavu pózovat, mrkne, a výraz pro přirozenější výsledek.

SadTalkerův kód je Apache-2.0, ale jeho 3D činky na rekonstrukci obličeje byly vycvičeny na Basel Face Model, jehož licence umožňuje pouze nekomerční výzkum. TTS.ai je komerční služba, takže nástroj byl vypnut 15. září 2026.

Tipy pro nejlepší výsledky

  • Použijte kvalitní, dobře osvětlený portrét viditelné oči, ústa zavřená
  • Středová tvář, čtverec nebo 4:5 poměr stran funguje nejlépe
  • Čistý zvuk řeči (bez hudby) přináší těsnější synchronizaci rtů
  • Povolit GFPGAN pro hrdinské záběry Doubles vykresluje čas, ale ořezává detail
  • Použijte stále přednastavený, když chcete stabilní avatar záběr

Synchronizované videoplány Lip

Start zdarma, upgrade, když potřebujete více

Volné
  • 30-sekundový audio limit
  • 256 px výstup
  • "Still" pouze přednastaveno
  • Žádný zesilovač obličeje
Nejoblíbenější
Volný účet
  • 30-sekundový audio limit
  • Oba "plná" a "stále" předvolby
  • 256 / 512 px výstup
  • GFPGAN zesilovač obličeje
Zaregistrovat se zdarma
Pro
  • 5-minutový audio limit
  • Prioritní fronta GPU
  • API přístup (multipart upload)
  • Webhook dokončení volání zpět
  • V současné době není k dispozici (neobchodní model licence)
Upgrade

Často kladené otázky

Nahrát fotku obličeje a audio klip, a AI generuje video tohoto obličeje mluvící zvuk s pohyby rtů, hlavy pózy a mrkne. Nástroj je v současné době nedostupný: běžel SadTalker (CVPR 2023), jehož 3D tváře rekonstrukce závaží byly vyškoleny na Basel Face Model, který je licencovaný pouze pro nekomerční výzkum.

Vstupem obličeje může být JPG nebo PNG obraz (až 10 MB) nebo krátké MP4/WebM driving video (používáme první snímek). Pohonný zvuk může být MP3, WAV, M4A, nebo FLAC až 10 MB. Přezkoušíme zvuk na 16 kHz interně.

Zdarma účty: až 30 sekund za klip. Platit uživatele: až 5 minut na vyžádání. Delší zvuk znamená delší dobu a vyšší cenu znaku.

Lip sync video používá 1000 znaků za sekundu generovaného videa. 30-sekundový klip = 30 000 znaků. Cena je fakturována předem z vašeho charakteru bilance a vrácen automaticky, pokud generace selže.

Ne. Nástroj je vypnutý, protože modelová licence to neumožňuje.SadTalker kód je Apache-2.0, ale jeho souborný síť obličej rekonstrukce byla vyškolena na Basel Face Model 2009, jehož licence umožňuje interní, nekomerční výzkum pouze. Videa generované s ním před 15. zářím 2026 nejsou pro komerční použití, placené plány zahrnuty. Jste odpovědní za to, že mají práva na zdrojový obličej image a audio nahrávat.

Když nástroj běžel, 5-sekundový klip trvalo asi 30 sekund, škálování zhruba lineárně s délkou zvuku. V současné době není k dispozici, zatímco my hledáme mluvící-hlava model, jehož licence umožňuje.

Plný přednastavený (výchozí) animuje hlavy póza, mžiky, a výraz spolu se rty, produkovat přirozenější mluvící-hlava video. Stále přednastavený zamkne hlavu na místě a oživuje pouze ústa?? užitečné, pokud chcete stabilní avatar záběr.

GFPGAN je model pro obnovu obličeje, který po vykreslení ostřejší detaily obličeje. Není nabízen: jeho předloha StyleGAN2 je pod nekomerční licencí NVIDIA a jeho model pro analýzu obličeje je CC BY-NC-SA.

SadTalker defaultně vykreslený na 256 px, s 512 px jako pomalejší varianta. Nástroj je v současné době nedostupný; dobře osvětlený, vysoce kvalitní portrét dává nejlepší výsledek s jakýmkoliv mluvícím-hlava modelu.

Ano. Nahrajte MP4 nebo WebM jako lícní vstup a my použijeme první snímek jako hnací identitu. Pro kompletní re-dubing videa (per-frame výměna úst), viz nadcházející Dabing Studio video potrubí.

Ano. POST a multipart request to /api/v1/lipsync/ with face and audio fields, then anfle /api/v1/lipsync/result/?uuid= until status is "completed." The response contains a URL to the maded MP4. API access requires a paid plan.

SadTalker používá face-laignment k detekci a plodin nejvýraznější tvář. Pro nejlepší výsledky, nahrát portrét s jednou osobou soustředěný, oči viditelné, a minimální okluze. Skupinové fotografie mohou přinést nepředvídatelné výsledky.
5.0/5 (1)

Co bychom mohli zlepšit? Vaše zpětná vazba nám pomáhá řešit problémy.

Připraveni začít?

Zaregistrujte se zdarma a získejte 15,000 znaků. Není vyžadována kreditní karta.