AI Lip -synkronointivideogeneraattori

Käännä kasvokuva ja ääninauha puhepäävideoksi, jossa on huulisynkroninen, pää poseeraa ja räpyttelee. Tällä hetkellä emme ole käytettävissä, kun etsimme mallia, jonka lisenssi sallii.

Lipin synkronointia ei ole juuri nyt saatavilla. SadTalkerin käyttämä malli on koulutettu vain ei-kaupalliseen tutkimukseen valtuutetussa Basel Face -mallissa, joten emme voi tarjota sitä maksullisessa palvelussa. Sopivan lisenssin vaihtamista ei ole vielä asennettu.

Lataa kasvot ja ääni

1 000 merkkiä sekunnissa

Vedä & pudota tiedostosi tähän, tai selaa

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

file.mp3

0 MB

Vedä & pudota tiedostosi tähän, tai selaa

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

file.mp3

0 MB

Käsitellään...

Videon renderointi vie yleensä 30 sekunnista 2 minuuttiin.

Puhuva päävideosi

Lataa MP4

Surullisesta puhujasta

SadTalker (CVPR 2023, Tencent ARC) on avoimen lähdekoodin puhe- ja päämalli, joka elävöittää yhden ainoan kasvokuvan puhuakseen mitä tahansa ääntä. Toisin kuin Wav2Lip -versiot, SadTalker myös animoi pään poseerausta, räpyttelyä ja ilmettä luontevasti.

SadTalkerin koodi on Apache-2.0, mutta sen 3D-kasvojen korjauspainot on koulutettu Baselin kasvomallissa, jonka lisenssi mahdollistaa vain ei-kaupallisen tutkimuksen. TTS.ai on kaupallinen palvelu, joten työkalu sammutettiin 15. syyskuuta 2026.

Vinkkejä parhaisiin tuloksiin

  • Käytä laadukasta, hyvin valaistua muotokuvaa – silmät näkyvissä, suu kiinni
  • Keskitetty kasvot, neliö tai 4:5 kuvasuhde toimii parhaiten
  • Puhdas puheääni (ei musiikkia) saa aikaan tiukempaa huulisynkronointia
  • Ota GFPGAN käyttöön sankarilaukausten varalta – tuplaa ajan mutta terävöittää yksityiskohtia
  • Käytä Still-asetinta, kun haluat tasaisen avatar-osuman

Lip-synkronointivideoiden piirustukset

Aloita ilmaiseksi, päivitä kun tarvitset lisää

Vapaa
  • 30 sekunnin ääniraja
  • 256 px:n ulostulo
  • Vain "vielä" esiaseteltuna
  • Ei kasvonvahvistinta
Suosituin
Vapaa tili
  • 30 sekunnin ääniraja
  • Sekä "täyttöiset" että "jäljellä olevat" esiasetukset
  • 256 / 512 px ulostulo
  • GFPGAN-face-tehosteaine
Rekisteröidy ilmaiseksi
Pro
  • 5 minuutin ääniraja
  • Ensisijainen GPU-jono
  • API-yhteys (moniosainen lataus)
  • Verkkokoukkujen takaisinkutsut
  • Tällä hetkellä ei saatavilla (ei-kaupallinen mallilisenssi)
Päivitys

Usein kysyttyjä kysymyksiä

Ladatkaa kasvokuva ja ääninauha, ja tekoäly luo videon, jossa ääni puhuu huulilla, pää poseeraa ja räpyttelee. Työkalua ei tällä hetkellä ole saatavilla: se johti SadTalkeria (CVPR 2023), jonka 3D-kasvojen korjauspainot koulutettiin Baselin kasvomallissa, joka on luvanvarainen vain ei-kaupalliseen tutkimukseen.

Kasvosyöte voi olla JPG- tai PNG-kuva (enintään 10 MB) tai lyhyt MP4/WebM-ajovideo (käytämme ensimmäistä ruutua). Ajoääni voi olla MP3-, WAV-, M4A- tai FLAC-ääni enintään 10 MB. Otamme ääninäytteen 16 kHz:n sisäisesti.

Ilmaiset tilit: jopa 30 sekuntia per klippi. Maksavat käyttäjät: jopa 5 minuuttia per pyyntö. Pidempi ääni tarkoittaa pidempää aikaa ja korkeampi luonne maksaa.

Lipin synkronointivideossa käytetään 1 000 merkkiä sekunnissa tuotettua videota. 30 sekunnin klippi = 30 000 merkkiä. Kustannukset laskutetaan etukäteen hahmon tasapainosta ja korvataan automaattisesti, jos sukupolvi epäonnistuu.

Ei. Työkalu on pois päältä, koska mallilisenssi ei sitä salli. SadTalkerin koodi on Apache-2.0, mutta sen niputettu kasvojen rekonstruktioverkko on koulutettu Baselin Face Model 2009 -mallilla, jonka lisenssi mahdollistaa vain sisäisen, ei-kaupallisen tutkimuksen. Videot, jotka on tuotettu ennen syyskuun 15. päivää, 2026 eivät ole kaupalliseen käyttöön, mukaan lukien maksulliset suunnitelmat. Vastuussa on oikeudet lataamaasi kasvokuvaan ja ääniaineistoon.

When the tool ran, a 5-second clip took about 30 seconds, scaling roughly linearly with audio length. It is currently unavailable while we look for a talking-head model whose license allows it.

Täysi esiaseteltu (oletus) animoidaan pää poseeraamaan, räpyttelemään ja ilmaisemaan yhdessä huulten kanssa, jolloin syntyy luonnollisempi puhe-päävideo. Silti esiaseteltu lukitsee pään paikoilleen ja animoi vain suuta, mikä on hyödyllistä, kun haluat tasaisen avatar-laukauksen.

GFPGAN on kasvojen restaurointimalli, joka terävöitti kasvonpiirteitä renderoinnin jälkeen. Sitä ei tarjota: sen StyleGAN2-ennen sitä on myönnetty NVIDIA-lisenssi, joka ei ole kaupallinen, ja sen kasvonpiirtomalli on CC BY-NC-SA.

SadTalker renderöitiin oletuksena 256 px:llä, ja hitaampana vaihtoehtona 512 px:llä. Työkalua ei tällä hetkellä ole saatavilla, ja hyvin valaistu, laadukas muotokuva antaa parhaan tuloksen minkä tahansa puhepäämallin kanssa.

Kyllä. Lataa kasvosyötteeksi MP4 tai WebM, ja käytämme ajoidentiteettinä ensimmäistä ruutua. Koko videon uudelleenjakoon (per-frame-suun vaihtoon) katso tulevaa Dubbing Studio -videoputkea.

Kyllä. POST a multipart request to /api/v1/lipsync/ with face and audio fields, then gallup /api/v1/lipsync/result/?uid=, kunnes status on " valmis". Vastaus sisältää URL-osoitteen renderoituun MP4:ään. API-yhteys vaatii maksullisen suunnitelman.

SadTalker käyttää kasvonpiirteitä tunnistaakseen ja kasvattaakseen näkyvimmät kasvot. Parhaiden tulosten saavuttamiseksi lataa muotokuva, jossa on yksi henkilö keskittyneenä, silmät näkyvillä ja minimaalinen tukos. Ryhmäkuvat saattavat tuottaa arvaamattomia tuloksia.
5.0/5 (1)

Mitä voisimme parantaa? Palautteesi auttaa meitä korjaamaan ongelmia.

Oletko valmis aloittamaan?

Rekisteröidy ilmaiseksi ja saat 50 opintopistettä. Luottokorttia ei tarvita.