АИ Лип Синхронизација видео генератор

Сврти слика од лицето и аудио клип во говорно-главно видео со синхронизација на усни, поза на главата и трепнува. Моментално не е достапно додека бараме модел чија дозвола дозволува.

Сеуште немаме ТТС гласови на твојот јазик. Продај го гласот
Моделот на СадТалкер кој го користеше беше обучен за Базел Фејс Модел, кој е само лиценца за некомерцијално истражување, па не можеме да го понудиме на платена услуга.

Качи го лицето + аудио

1000 знаци во секунда

Довлечи и пушти ја тука вашата датотека, или прегледај

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

file. mp3

0 MB

Довлечи и пушти ја тука вашата датотека, или прегледај

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

file. mp3

0 MB

Обработувам...

Тоа обично трае 30 секунди до 2 минути.

Твоето видео со говорна глава

Симнување

За Тажниот Талер

SadTalker (CVPR 2023, Tencent ARC) е модел на говорење со отворен извор кој анимира една слика со лице за да зборува каков било аудио. За разлика од Wav2Lip варијанти, SadTalker исто така анимира позиција на главата, трепка и израз за поприроден резултат.

Кодот на СадТалкер е Апачи-2.0, но нејзините 3Д тегови за реконструкција на лицето беа обучени за Базелскиот модел на лицето, чија дозвола дозволува некоммерцијално истражување. TTS.ai е комерцијална услуга, па алатката беше исклучена на 15 септември 2026 година.

Совети за најдобри резултати

  • Користете висококвалитетен, добро осветлен портрет — очи видливи, уста затворена
  • Центарот на лицето, квадратот или 4:5 односот на аспектот е најдобар
  • Чист говор аудио (без музика) дава потесна синхронизација на усни
  • Овозможи GFPGAN за истрели од херојот — двојно го прикажува времето, но го остри деталите
  • Користи го претпоставувањето на Сѐ уште кога сакаш стабилно снимање со аватар

Видео планови за Лип Синхронизација

Стартувај бесплатно, надоградете кога ќе ви треба повеќе

Слободен
  • Ограничување на звукот од 30 секунди
  • 256 px излез
  • Само претпоставување на „ и понатаму “
  • Нема појачување на лицето
Најпопуларно
Слободна сметка
  • Ограничување на звукот од 30 секунди
  • И „ полн “ и „ сеуште “ поставувања
  • 256 / 512 px излез
  • GFPGAN појачувач на лицето
Слободно потпиши се
Проф.
  • Ограничување на звукот од 5 минути
  • Приоритетна GPU- редица
  • Пристап на API (многу делови)
  • Повратен повик за довршување на веб- куќи
  • Моментално недоступна (некомерцијална лиценца за модел)
Надоградба

Често поставувани прашања

Пушти слика од лицето и аудио клип, и ВИ генерира видео од тоа лице говорејќи го аудиото со движење на усни, позиција на главата и трепкање. Алатката моментално е недостапна: го изврши СадТалкер (CVPR 2023), чии 3D тегови на реконструкција на лицето беа обучени за Базел Фејс моделот, кој е дозволен само за некомерцијално истражување.

Влезот на лицето може да биде JPG или PNG слика (до 10 MB) или кратко возачко видео MP4/WebM (го користиме првата рамка). Управниот аудио може да биде MP3, WAV, M4A или FLAC до 10 MB. Внатрешна проба на аудио на 16 kHz.

Бесплатни сметки: до 30 секунди по клип. Плаќање на корисниците: до 5 минути по барање. Подолго аудио значи подолго време и повисока цена на знаците.

Видеото за синхронизација на липсата користи 1.000 знаци во секунда од генерираното видео. 30-секунди клип = 30.000 знаци. Цената се плаќа однапред од балансот на вашиот карактер и се враќа автоматски ако генерацијата не успее.

Не. Алатката е исклучена бидејќи не дозволува тоа. Кодот на СадТалкер е Apache-2.0, но нејзината мрежа за реконструкција на лицето беше обучена за Базејл Фејс моделот 2009, чија лице дозволува внатрешно, некоммерцијално истражување. Видеото генерирани со неа пред 15 септември 2026 не се за комерцијална употреба, вклучуваат платени планови. Вие сте одговорни за тоа што имате права на изворната слика и аудиото што го внесете.

Кога алатката работи, на клип од 5 секунди траеше околу 30 секунди, скалирање приближно линеарно со аудио должина. Моментално е недостапен додека бараме модел на зборувачка глава чија дозвола ја дозволува.

Целосна претпоставка (стандардно) анимира позиција на главата, трепка и израз заедно со усните, создавајќи поприродно видео со зборувачка глава. Сеуште ја заклучува главата на место и ја анимира само устата — корисна кога сакате стабилно снимање на аватарот.

GFPGAN е модел за реставрација на лицето кој ги наостри деталите на лицето по рефлектирањето. Не е понудена: неговиот стилGAN2 претходно е под НВИДИА некомерцијална лицево лице, а нејзиниот модел за анализирање на лицето е CC BY-NC-SA.

Тажниот талератор што е нацртан на 256 px стандардно, со 512 px како побавна опција. Алатката моментално е недостапна; осветлен, висококвалитетен портрет дава најдобар резултат со било кој модел на зборувачка глава.

Да. Внесете MP4 или WebM како влез на лицето и ние ќе ја искористиме првата рамка како идентитет на возење.

Да. ПОСТ мултиделно барање до /api/v1/lipsync/ со лице и аудио полиња, потоа анкета / api/ v1/lipsync/ result/?uid= додека статусот не биде „ завршен “. Одговорот содржи URL до пренесениот MP4. API пристапот бара платен план.

За најдобри резултати, поставете портрет со една личност, видливи очи и минимална оклузија. Групните фотографии можат да дадат непредвидливи резултати.
5.0/5 (1)

Твоите повратни информации ни помагаат да ги решиме проблемите.

Подготвен си да почнеш?

Пријавете се бесплатно и добиете 15.000 знаци.