Програма для створення відео-відтворення AILap

Перетворює фотографію обличчя і аудіо кліп на відео з розмовною синхронізацією губ, позою і блиманням. Зараз ми не можемо знайти модель, чия ліцензія надала це можливість.

Зараз синхронізації з Ліпом недоступні. Модель Садівника, яку він використовував, була тренована на моделі базового обличчя, яку ліцензовано лише для некомерційних досліджень, отже ми не можемо запропонувати цю модель за допомогою оплачуваної служби. Заміну відповідної ліцензії ще не встановлено.

Вивантаження лицьового боку + аудіо

1000 символів на секунду

Перетягніть і скиньте ваш файл сюди або перегляд

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

file.mp3

0 MB

Перетягніть і скиньте ваш файл сюди або перегляд

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

file.mp3

0 MB

Обробка...

Зазвичай, це займає 30 секунд до 2 хвилин.

Відеозапис "Голод" object name (optional)

Звантажити MP4

Про Саддика

Sadtricker (CVPR 2023, Tencent ARC) - це модель з відкритим кодом, яка анімує окреме зображення обличчя для вимовляння будь- якого звуку. На відміну від варіантів Wav2Lip, Sadtricker також оживляє позу, блимання і вираз для більш природного результату.

Кодом Саддика є Apache- 2.0, але його 3D-відновлення особи було вивчено на моделі Базель Face, ліцензія якої дозволяє лише некомерційні дослідження. TTS.ai є комерційною службою, отже інструмент було вимкнено 15 вересня 2026 року.

Поради для найкращих результатів

  • Використовувати високоякісну, добре освітлену п'єсу очі видимі, рот закрито
  • Найкраще працює централізоване обличчя, співвідношення квадрата або 4:5
  • Чистий звук мовлення (без музики) дає тіснішу синхронізацію губ
  • Уможливити GFPGAN для героїв, які влучають у подвійне виконання часу, але гострять деталі.
  • Використовувати набір Till, якщо ви бажаєте, щоб сталий удар аватара

Ліп Синхронізувати відеоплани

Запустити вільний, оновити, якщо потрібно більше

Вільно
  • Обмеження звуку в 30 секундах
  • 256 пк вивід
  • Лише конфігурація " Still "
  • Не покращувати обличчя
Найпоширеніша
Вільний рахунок
  • Обмеження звуку в 30 секундах
  • Конфігурації " full " і " все ж "
  • 256 / 512 вивід px
  • Вдосконалення обличчя GFPGAN
Вільний підпис
Pro
  • 5- хвилинне обмеження звуку
  • Черга пріоритету GPU
  • Доступ до API (багаточастине вивантаження)
  • Зворотні виклики завершення веб- сторінок
  • Зараз недоступна (некомерційна ліцензія моделі)
Оновити

Часті запитання

Вивантажити фотографію обличчя і звуковий кліп, а комп' ютерного гравця створює відео з цього обличчя, що говорить звук з рухом губ, головою і блиманням. У поточній версії інструмент не може бути наявним: він запустив Sadtricker (CVPR 2023), його 3D- відбудовані ваги обличчя були вивчені на моделі Базель Face, яку було дозволено лише для некомерційних досліджень.

Ввід обличчя може бути зображення JPG або PNG (до 10 МБ) або коротке відео, що водить MP4/ WebM (ми використовуємо перший кадр). Звук, що керує, може бути MP3, WAV, M4AC або FLAC до 10 МБ. Ми перенаходимо від 16 кГц внутрішньо.

Вільні рахунки: до 30 секунд на кліп. Користувачі оплачують: до 5 хвилин на запит. Довші аудіо означають довшу вартість відтворення часу і вищого символу.

Відео про синхронізацію клавіш використовує 1000 символів на секунду від створеного відео. У 30- секундному відео = 30 000 символів. Ціну буде оцінено на початку з вашого балансу символів і автоматично змінено, якщо спроба створення зазнає невдачі.

No. The tool is switched off because the model license does not allow it. SadTalker code is Apache-2.0, but its bundled face reconstruction network was trained on the Basel Face Model 2009, whose license allows internal, non-commercial research only. Videos generated with it before September 15, 2026 are not for commercial use, paid plans included. You are responsible for having the rights to the source face image and audio you upload.

When the tool ran, a 5-second clip took about 30 seconds, scaling roughly linearly with audio length. It is currently unavailable while we look for a talking-head model whose license allows it.

Повна демонстрація (типова) голова, моргання, і вираз разом з губами, створення більш природного відео з розмовною головою.

GFPGAN - це модель відновлення обличчя, яка загострила деталі обличчя після його відтворення. Вона не пропонується: її попередній StyleGAN2 знаходиться під некомерційною ліцензією NVIDIA, а його моделлю обробки обличчя - CC BY- BC-SA.

Типово, sadkuler, який показується з 256 px, 512 px як повільніший параметр. Зараз інструмент недоступний; добре освітлений, високоякісний портрет дає найкращі результати для будь- якої моделі говорення.

Так. Вивантажте MP4 або WebM як вхідні дані обличчя і ми використаємо перший кадр як рушійну особу. Повне відео перевищення (на блокі для заміни ротової порожнини) можна знайти на наступній каналі відеострічності.

Так. POST - запит на / api/ v1/lipsync / з полями обличчя і звуку, а потім запит / api/ v1/lipsync/ result /? uuid=, аж доки не буде " завершено." Відповідь містить адресу URL для відображеного MP4. Для доступу до API потрібен сплачений план.

Для того, щоб виявити і обрізати найвідоміше обличчя, Саддикер використовує особу- вимову. Найкращі результати: вивантажте портрет з однією особою у центрі уваги, видимими очима і мінімальним включенням. Фотографії групи можуть призвести до непередбачуваних результатів.
5.0/5 (1)

Ваші відгуки допомагають нам вирішити проблеми.

Готові починати?

Підписатися безкоштовно і отримати 15 000 символів. Не потрібно жодної кредитної картки.