AI Lip Sync Video Generator

Kthe një foto të fytyrës dhe një klip audio në një video me kokë që flet me sinkronizim buzësh, pozicion kokë dhe shkëlqim sysh. Aktualisht nuk është në dispozicion ndërsa kërkojmë një model licensa e të cilit e lejon këtë.

Ende nuk kemi zëra TTS në gjuhën tuaj. Na ndihmoni të shtojmë të tuajat! Shit zërin tënd
Sinkronizimi i buzëve nuk është në dispozicion për momentin. Modeli SadTalker që përdoret është trajnuar në modelin e fytyrës Basel, i cili është licencuar vetëm për kërkime jo komerciale, kështu që nuk mund ta ofrojmë atë në një shërbim të paguar. Asnjë zëvendësim me një licencë të përshtatshme nuk është instaluar ende.

Shto Face + Audio

1,000 karakterë për sekondë

Tërhiq dhe lësho file këtu ose shfleto

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

file.mp3

0 MB

Tërhiq dhe lësho file këtu ose shfleto

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

file.mp3

0 MB

Duke përpunuar...

Duke shfaqur videon tuaj. Kjo zakonisht merr nga 30 sekonda deri në 2 minuta.

Videoja jote Talking-Head

Shkarko

SadTalker

SadTalker (CVPR 2023, Tencent ARC) është një model i kokës folëse me burim të hapur që animon një imazh të vetëm fytyre për të folur çdo tingull. Ndryshe nga variantet Wav2Lip, SadTalker gjithashtu animon pozicionin e kokës, shikimin e syve dhe shprehjen për një rezultat më natyror.

Kodi i SadTalker është Apache-2.0, por peshat e tij të rindërtimit të fytyrës 3D u trajnuan në Modelin e Bazel Face, liçenca e të cilit lejon vetëm kërkime jo-komerciale. TTS.ai është një shërbim komercial, kështu që instrumenti u mbyll më 15 shtator 2026.

Këshillat për rezultatet më të mira

  • Përdor një portret me cilësi të lartë dhe të ndriçuar mirë - sytë të dukshëm, goja e mbyllur
  • Fytyra e qendruar, katrore ose raporti i aspektit 4:5 funksionon më mirë
  • Zëri i pastër i foljes (pa muzikë) jep sinkronizim më të ngushtë buzësh
  • Aktivizo GFPGAN për goditjet heroike - dyfishon kohën e paraqitjes por mpreh detajet
  • Përdor paracaktimin e qëndrueshëm kur dëshiron një fotografi të qëndrueshme të avatar-it

Sync

Fillo falas, përmirëso kur të duash më shumë

I lirë
  • Kufiri audio 30 sekonda
  • 256 px output
  • Vetëm "Still" e paracaktuar
  • Pa përmirësim të fytyrës
Popullariteti
Profili i lirë
  • Kufiri audio 30 sekonda
  • Paracaktimi "full" dhe "still"
  • 256 / 512 px output
  • Përmirësues i fytyrës GFPGAN
Regjistrohu
Pro
  • Kufiri audio 5 minuta
  • Prioriteti i GPU
  • API access (multipart upload)
  • Përfundimi i thirrjeve të webhook
  • Aktualisht jo në dispozicion (liçenca jo-komerciale)
Përmirëso

Pyetje të shpeshta

Ngarko një foto të fytyrës dhe një klip audio, dhe AI gjeneron një video të asaj fytyre duke folur zërin me lëvizje buzësh, pozicion kokë dhe shikime sysh. Instrumenti është aktualisht i papërdorshëm: ai përdor SadTalker (CVPR 2023), peshat e rindërtimit të fytyrës 3D të të cilit u trajnuan në modelin e fytyrës Basel, i cili është licencuar vetëm për kërkime jo-komerciale.

Input i fytyrës mund të jetë një figurë JPG ose PNG (deri në 10 MB) ose një video e shkurtër MP4/WebM e vozitjes (ne përdorim kornizën e parë). Zëri i vozitjes mund të jetë MP3, WAV, M4A, ose FLAC deri në 10 MB. Ne ri-shembullojmë audion në 16 kHz brenda.

Përdoruesit pa pagesë: deri në 5 minuta për kërkesë. Një audio më e gjatë do të thotë një kohë më e gjatë e interpretimit dhe një kosto më e lartë e karaktereve.

Video me sinkronizim buzësh përdor 1,000 karaktere për sekond të video së gjeneruar. Një klip 30 sekondash = 30,000 karaktere. Kostoja llogaritet paraprakisht nga balanca e karaktereve dhe kthehet automatikisht nëse gjenerimi dështon.

Jo. Instrumenti është i ç'aktivuar sepse licenca e modelit nuk e lejon këtë. Kodi SadTalker është Apache-2.0, por rrjeti i rindërtimit të fytyrës i përfshirë është trajnuar në Basel Face Model 2009, liçenca e të cilit lejon vetëm kërkime të brendshme, jo komerciale. Videot e gjeneruara me të para 15 shtatorit 2026 nuk janë për përdorim komercial, përfshirë planet e paguar. Jeni përgjegjës për të drejtat e burimit të imazhit të fytyrës dhe audios që ngarkoni.

Kur instrumenti u shfaq, një klip 5 sekondash mori rreth 30 sekonda, duke u shkallëzuar pothuajse linearisht me gjatësinë e audios. Aktualisht nuk është në dispozicion ndërsa kërkojmë një model të kokës së foljes që licenca e tij e lejon këtë.

Paracaktimi i plotë (i prezgjedhur) animon pozicionin e kokës, shikimin e syve dhe shprehjen së bashku me buzët, duke prodhuar një video më natyrale me kokën që flet. Paracaktimi i mbetur bllokon kokën në vend dhe animon vetëm gojën - i dobishëm kur dëshiron një avatar të qëndrueshëm.

GFPGAN është një model restaurimi fytyre që mpreh hollësitë e fytyrës pas renderimit. Nuk ofrohet: StyleGAN2 i tij i mëparshëm është nën një licencë jo komerciale NVIDIA dhe modeli i tij i analizimit të fytyrës është CC BY-NC-SA.

SadTalker paraqitet në 256 px në mënyrë të paracaktuar, me 512 px si një opsion më të ngadalshëm. Instrumenti nuk është aktualisht në dispozicion; një portret me cilësi të lartë dhe i ndriçuar mirë jep rezultatin më të mirë me çdo model koke folëse.

Po. Ngarko një MP4 ose WebM si hyrje të fytyrës dhe do të përdorim kornizën e parë si identitetin e drejtimit. Për ri-dublimin e plotë të video (zëvendësimi i gojës për kornizë), shiko videon e ardhshme Dubbing Studio.

Po. POST një kërkesë me shumë pjesë tek /api/v1/lipsync/ me fushat e fytyrës dhe audios, pastaj pyet /api/v1/lipsync/result/?uuid= derisa gjendja të jetë "e plotësuar". Përgjigjia përmban një URL të MP4 të renderuar. Hyrja në API kërkon një plan të paguar.

SadTalker përdor rregullimin e fytyrës për të zbuluar dhe prerë fytyrën më të dukshme. Për rezultate më të mira, ngarko një portret me një person në qendër, sytë e dukshëm dhe me një mbyllje minimale. Fotot e grupit mund të japin rezultate të paparashikuara.
5.0/5 (1)

Çfarë mund të përmirësojmë? Feedback-i juaj na ndihmon të zgjidhim problemet.

Gati për të filluar?

Regjistrohu falas dhe merr 15,000 karaktere.