Pranešti apie klaidą / funkcijų užklausą

AI Lip sinchronizuoti vaizdo generatorių

Įjunkite veido nuotrauką ir garso įrašą į kalbančiųjų galvos vaizdo įrašą su lūpų sinchronizacija, galvos pozicija ir mirksėjimas. Šiuo metu neprieinami, kai ieškome modelio, kurio licencija leidžia.

Mes dar neturime TTS balsų jūsų kalba. Padėk mums pridėti savo! Parduoti savo balsą
Lip sinchronizacija nėra prieinama dabar. SadTalker modelis, kurį ji naudojo buvo mokoma Bazelio Veido modelis, kuris yra licencijuotas tik nekomerciniams tyrimams, todėl mes negalime pasiūlyti jį už mokamą paslaugą. Pakeitimas su tinkama licencija dar nėra įdiegta.

Išsiųsti veidą + garsą

1000 ženklų per sekundę

Vilkite ir meskite failą čia, arba naršyti

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

file.mp3

0 MB

Vilkite ir meskite failą čia, arba naršyti

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

file.mp3

0 MB

Apdorojama...

Vaizdo siuntimas. Paprastai tai trunka nuo 30 sekundžių iki 2 minučių.

Jūsų kalbėjimo viršūnės vaizdo įrašas

Atsiųsti

Apie SadTalker

SadTalker (CVPR 2023, Tencent ARC) yra atviro šaltinio kalbėjimo-galvos modelis, kuris animuoja vieną veido vaizdą kalbėti bet kokį garsą. Skirtingai nuo Wav2Lip variantų, SadTalker taip pat animuoja galvą kelia, mirksi, ir išraiška labiau natūralus rezultatas.

SadTalker kodas yra Apache-2.0, bet jo 3D veido rekonstrukcijas svoris buvo mokomi Bazelio veido modelis, kurio licencija leidžia nekomerciniai tyrimai tik. TTS.ai yra komercinė paslauga, todėl įrankis buvo išjungtas rugsėjo 15, 2026.

Patarimai geriausiems rezultatams

  • Naudokite aukštos kokybės gerai apšviestą portretą — matomas akis, užkimštas burnas
  • Centruotas veidas, kvadratas arba 4:5 matmenų santykis veikia geriausiai
  • Švarios kalbos garso (be muzikos) duoda griežtesnės lūpų sinchronizacija
  • Įjungti GFPGAN herojų kadrams — dvigubos piešimo laiką, bet aštrina detales
  • Naudoti vis dar iš anksto nustatytą, kai norite pastovaus avataro kadrą

Lip sinchronizuoti vaizdo įrašus

Pradėti nemokamai, atnaujinti, kai jums reikia daugiau

Neapmuitinama
  • 30 sekundžių garso riba
  • 256 px išvestis
  • Tik „Still“ iš anksto nustatyta
  • Nėra veido stiprintuvo
Populiariausi
Nemokama paskyra
  • 30 sekundžių garso riba
  • Tiek „visiškas“, tiek „vis dar“ iš anksto nustatytas
  • 256 / 512 px išvestis
  • GFPGAN veido stiprintuvas
Užsiregistruoti nemokamai
Pro
  • 5 minučių garso riba
  • Prioritetinis GPU eilė
  • API prieiga (daugiadalis įkeltas)
  • Webhook skambučiai
  • Šiuo metu neprieinama (nekomercinė modelio licencija)
Atnaujinti

Dažnai užduodami klausimai

Įkelkite veido nuotrauką ir garso klipą, o AI sukuria vaizdo apie tą veidą kalbėti garsą su lūpų judesių, galvos pozicionavimo ir mirksi. Įrankis šiuo metu nėra prieinama: jis veikia SadTalker (CVPR 2023), kurio 3D veido rekonstrukcijas svarmenys buvo mokomi naudojant Bazelio veido modelį, kuris yra licencijuotas tik nekomerciniams tyrimams.

Veido įvestis gali būti JPG arba PNG atvaizdas (iki 10 MB) arba trumpas MP4/WebM vairavimo vaizdo (mes naudojame pirmąjį kadrą). Vairavimo audio gali būti MP3, WAV, M4A arba FLAC iki 10 MB. Mes iš naujo imame garsą į 16 kHz viduje.

Nemokamos sąskaitos: iki 30 sekundžių vienam klipui. Mokėjimas vartotojams: iki 5 minučių už užklausą. Ilgesnis garsas reiškia, kad ilgiau atvaizduoti laiką ir didesnė simbolių kaina.

Lip sinchronizuoti vaizdo naudoja 1000 simbolių per sekundę generuojamo vaizdo. 30 sekundžių klipas = 30.000 simbolių. Sąnaudos yra apskaitomos iki priekio iš savo simbolių balanso ir kompensuojama automatiškai, jei generacija nepavyksta.

Ne. Įrankis išjungiamas, nes modelio licencija neleidžia. SadTalker kodas yra Apache-2.0, bet jo komplektuotas veido rekonstrukcija tinklas buvo mokomas Bazelio veido modelis 2009, kurio licencija leidžia tik vidaus, nekomerciniai tyrimai. Vaizdo įrašai, sukurti su juo iki rugsėjo 15, 2026 nėra komercinio naudojimo, apmokamų planų įtraukti. Jūs esate atsakingas už turėti teises į šaltinio veido vaizdą ir garso įkelti.

Kai buvo įrankis, 5 sekundžių klipas užtruko apie 30 sekundžių, maždaug tiesiškai didėjant garso ilgiui. Šiuo metu jis nėra pasiekiamas, o mes ieškome kalbėjimo-galvos modelio, kurio licencija leidžia.

Visą iš anksto nustatytą (numatytą) animatus galva kelia, mirksi ir išraiškos kartu su lūpomis, sukuriant natūralų kalbėjimo galvutę. Vis dar iš anksto užrakina galvą vietoje ir animuoja tik burną — naudinga, kai norite pastovaus avataro kadrą.

GFPGAN yra veido atkūrimo modelis, kuris sustiprino veido detales po atvaizdavimo. Ji nėra siūloma: jos StyleGAN2 prieš yra pagal NVIDIA nekomercinės licencijos ir jos veido doringas modelis yra CC BY-NC-SA.

SadTalker, pagal nutylėjimą atvaizdavus 256 px, su 512 px lėtesniu nustatymu. Įrankis šiuo metu nėra prieinamas; gerai apšviestas, aukštos kokybės portretas suteikia geriausią rezultatą su bet kokiu kalbėjimo-galvos modeliu.

Taip. Įkelkite MP4 arba WebM kaip veido įvesties, ir mes naudojame pirmąjį kadrą kaip vairavimo identitetą. Dėl pilno vaizdo perdubliavimas (per kadrą burnos pakeitimas), žiūrėkite artėjantį Dubbing Studio video vamzdyną.

Taip. Padėkite daugiadalį užklausą /api/v1/lipsync/ su veido ir garso laukais, tada apklauskite /api/v1/lipsync/results/?uid= kol būsena bus "užbaigta". Atsakyme pateikiamas MP4 URL. API prieigai reikalingas apmokamas planas.

SadTalker naudoja veido sureguliavimas aptikti ir pasėlių labiausiai pastebimą veidą. Dėl geriausių rezultatų, įkelti portretą su vienu asmeniu centre, akių matomas, ir minimalus užsikimšimas. Grupės nuotraukos gali sukelti nenuspėjamus rezultatus.
5.0/5 (1)

Ką mes galėtume pagerinti? Jūsų atsiliepimai padeda mums išspręsti problemas.

Pasiruošęs pradėti?

Užsiregistruoti nemokamai ir gauti 15,000 simbolių. Nereikia kredito kortelės.