Генэратар відэа з сінхранізацыяй губ

Пераўтварыць фота асобы і аўдыякліп у відэа з размовай галавы з сінхранізацыяй губ, пазіцыяй галавы і мігаценнем. Зараз недаступна, пакуль мы шукаем мадэль, якая дазваляе гэта.

Сінхранізацыя губаў зараз недаступная. Модуль SadTalker, які яна выкарыстоўвае, быў навучаны на Basel Face Model, які ліцэнзаваны толькі для некамэрцыйных даследаванняў, таму мы не можам прапанаваць яго ў якасці платнага сервісу. Замена з адпаведнай ліцэнзіяй яшчэ не ўстаноўлена.

Перазапісаць файл?

1000 знакаў у секунду

Перацягніце файл сюды, або прагляд

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

файл.mp3

0 MB

Перацягніце файл сюды, або прагляд

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

файл.mp3

0 MB

Апрацоўка...

Рэндынг відэа. Звычайна гэта займае ад 30 секунд да 2 хвілін.

Ваша відэа Talking- Head

Сцягнуць

Пра SadTalker

SadTalker (CVPR 2023, Tencent ARC) — гэта мадэлі размаўляючай галавы з адкрытым зыходным кодам, якія анімуюць адзінае выяву твару для размаўляння любога гуку. У адрозненне ад варыянтаў Wav2Lip, SadTalker таксама анімуе пазіцыю галавы, мігценні і выраз твару для больш натуральнага выніку.

SadTalker's code is Apache-2.0, but its 3D face reconstruction weights were trained on the Basel Face Model, whose license allows non-commercial research only. TTS.ai is a commercial service, so the tool was switched off on September 15, 2026.

Парады для лепшых вынікаў

  • Выкарыстоўваць высокакваліфікаваны, добра асветлены партрэт - вочы бачны, рот зачынены
  • Найбольш падыходзіць па цэнтры, квадратная або 4: 5
  • Праца з гукам (без музыкі) дае большую сінхранізацыю губ
  • Уключыць GFPGAN для выбухаў герояў - удвая павялічыць час рэндрынгу, але павялічыць дэталі
  • Выкарыстоўвайце налады стабільнасці, калі вы хочаце стабільны здымак аватара

Сінхранізацыя губ

Пачаць бясплатна, абнавіць, калі спатрэбіцца больш

Вольна
  • 30-секундны аўдыё-абмежаванне
  • Вывад 256 px
  • Толькі "Стойкі" набор
  • Без падсвятлення твару
Самыя папулярныя
Вольны рахунак
  • 30-секундны аўдыё-абмежаванне
  • Абедзве налады "full" і "still"
  • Вывад 256 / 512 px
  • Падвышальнік выявы GFPGAN
Падпісацца бясплатна
Прафесійны
  • 5- хвілінны аўдыё- абмежаванне
  • Чарга прыярытэтнага GPU
  • Даступ да API (загрузка некалькіх частак)
  • Зваротныя выклікі дапаўнення Webhook
  • Зараз недаступны (некамэрцыйная ліцэнзія)
Абнавіць

Частыя пытанні

Загрузіце фота асобы і аўдыякліп, і машынны інтэлект створыць відэа гэтай асобы, якая гаворыць з рухамі губ, пазіцыяй галавы і мігаценнем. Гэтая праграма пакуль недаступная: яна запускае SadTalker (CVPR 2023), 3D- рэканструкцыю асобы, якая была трэніраваная на Basel Face Model, якая ліцэнзаваная толькі для некамэрцыйных даследаванняў.

Уводам для выявы можа быць JPG або PNG малюнак (да 10 Мб) або кароткае відэа MP4/ WebM (мы выкарыстоўваем першы кадр). Аудыа можа быць MP3, WAV, M4A або FLAC да 10 Мб. Мы рэдыспеплюем аўдыё да 16 кГц унутрана.

Бездакорны

Відэа з сінхранізацыяй губ выкарыстоўвае 1000 знакаў на секунду. 30- секундны фільм = 30 000 знакаў. Кошт фільма будзе зараней улічаны ў вашым балансе знакаў і аўтаматычна вярнуты, калі стварэнне не атрымаецца.

No. The tool is switched off because the model license does not allow it. SadTalker code is Apache-2.0, but its bundled face reconstruction network was trained on the Basel Face Model 2009, whose license allows internal, non-commercial research only. Videos generated with it before September 15, 2026 are not for commercial use, paid plans included. You are responsible for having the rights to the source face image and audio you upload.

Калі праграма запускалася, 5- секундны фільм займаў каля 30 секунд, і яго працягласць змянялася ў адпаведнасці з даўжынёй гуку. У цяперашні час праграма недаступная, пакуль мы шукаем мадэль гаворчай галавы, якая дазваляе гэта.

Па змаўчанні анімацыя галавы, мігаценне і выраз твару анімуюцца разам з губамі, што дае больш натуральны выгляд гаворчай галавы. Па змаўчанні галава застаецца на месцы, анімуецца толькі рот. Гэта карысна, калі вы хочаце, каб аватар быў стабільна анімаваны.

GFPGAN - гэта мадэль аднаўлення твараў, якая загартвае дэталі твараў пасля рэндрынгу. Яна не прапануецца: яе StyleGAN2 раней пад некамэрцыйнай ліцэнзіяй NVIDIA, а яе мадэль аналізу твараў - CC BY-NC-SA.

Па змаўчанні SadTalker паказваецца ў 256 пікселях, з 512 пікселямі як павольным выбарам. Гэтая праграма пакуль недаступная; добра асветлены, высокакваліфікаваны партрэт дае найлепшы вынік з любой мадэллю гаворачай галавы.

Так. Загрузіце файл MP4 або WebM як увод для твару, і мы будзем выкарыстоўваць першы кадр як ідэнтыфікатар. Для поўнага перадублікавання відэа (замена вуснаў па кадрах), глядзіце будучы відэа канвеер Dubbing Studio.

Так. POST шматчасткавы запыт у /api/v1/lipsync/ з полямі для твару і гуку, затым праверце /api/v1/lipsync/result/?uuid=, пакуль стан не стане "завершаны". Адказ змяшчае URL да рэндраванага MP4. Для доступу да API патрабуецца платны план.

SadTalker выкарыстоўвае выраўноўванне асобы для выяўлення і абрэзкі найбольш выразнага твару. Для лепшых вынікаў загружайце партрэт з адным чалавекам у цэнтры, з відавочнымі вачыма і мінімальным захопам. Групавыя фатаграфіі могуць мець неасцярожныя вынікі.
5.0/5 (1)

Што мы можам палепшыць? Ваша ацэнка дапаможа нам выправіць праблемы.

Вы гатовыя пачаць?

Зарэгіструйцеся бясплатна і атрымайце 50 крэдытных балаў. Крэдытная карта не патрабуецца.