Қате / мүмкіндік туралы хабарлау

AI еріндерді қадамдастыру бейне генераторыName

Көз фотосурет пен аудио клибін ауыз синхронизациясы, бас ұстау және көз жасын лақтырумен сөйлеп тұрған бас бейнесіне айналдыру. Лицензиясы рұқсат ететін модельді іздеп жатқанда қолжетімді емес.

Қадамдастыру мүмкін емес. SadTalker- дің қолданған үлгісі Basel Face Model- де оқытылды, ол тек коммерциялық емес зерттеу үшін лицензияланған, сондықтан біз оны төлемді қызмет ретінде ұсына алмаймыз. Қазірге сәйкесті лицензиямен алмастырушы орнатылмаған.

Сурет пен аудионы жүктеп беру

1000 таңба/ сек

Файлды мұнда сүйреп апарыңыз, не шолу

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

файл.mp3

0 MB

Файлды мұнда сүйреп апарыңыз, не шолу

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

файл.mp3

0 MB

Жұмсау...

Бейнені көрсету. Бұл әдетте 30 секундтан 2 минутқа дейін созылады.

Сіздің сөйлеп тұрған басыңызName

Жүктеп алу

SadTalker туралы

SadTalker (CVPR 2023, Tencent ARC) - ашық көзі бар, кез келген дыбысты сөйлету үшін бір беттің суретін анимациялайтын сөйлеп тұрған бас моделі. Wav2Lip нұсқаларынан айырмашылығы, SadTalker бас ұстауын, көз жасын және жүзін де анимациялай алады, нәтижесі табиғи көрінеді.

SadTalker коды Apache-2.0, бірақ оның 3D бет реконструкциясы салмағы Basel Face Model-де оқытылды, оның лицензиясы тек коммерциялық емес зерттеуге мүмкіндік береді. TTS.ai коммерциялық қызмет, сондықтан құрал 15 қыркүйекте 2026 жылы өшірілді.

Ең жақсы нәтиже үшін кеңестер

  • Жоғары сапалы, жақсы жарықтандырылған портретті қолдану - көзі көрінеді, ауыз жабық
  • Ортаға қойылған, шаршы немесе 4: 5 өлшемі ең жақсы
  • Аудио дыбысы таза (муз. жоқ) болса, тілдің қадамдастыруы жақсарады
  • Қаһармандардың суреттерін түсіру үшін GFPGAN болсын - рендеринг уақытын екі есеге арттырады, бірақ егжей- тегжейін айқындай түседі
  • Аватардың тұрақты суреті керек болса, "Тұрақты" дегенді қолданыңыз

Сөздерді қадамдастыру видео жоспарларыName

Тегін бастаңыз, қажет болғанда жаңартыңыз

Бос
  • Аудио 30 секунд шегі
  • 256 px шығысы
  • Тек "Столкновение" алдын- ала орнатылған
  • Сурет жақсартуы жоқ
Ең танымалы
Бос тіркелгі
  • Аудио 30 секунд шегі
  • "толық" және "тұрақты" алдын- ала орнатулар
  • 256 / 512 н/ д шығысы
  • GFPGAN бетті жақсарту
Тегін тіркелу
Про
  • Аудио 5 минут шегі
  • Артықшылықты GPU кезегі
  • API қатынау (көп бөліктен жүктеу)
  • Webhook толықтыру қайтарулары
  • Қазір қол жеткізбейді (коммерциялық емес модель лицензиясы)
Жаңарту

Жиі қойылатын сұрақтар

Көздің суреті мен аудио клибін жүктеп, ДНҚ осы көздің бейнесін жасап, аудио, мұрын қозғалысы, бас ұстау және көз жасын төгу арқылы сөйлеп береді. Бұл құрал қазір қол жетімді емес: SadTalker (CVPR 2023) қолданылады, оның 3D көз реконструкциялау салмағы Basel Face Model-де оқытылды, ол тек коммерциялық емес зерттеу үшін лицензияланған.

Файлды енгізу үшін JPG немесе PNG кескіні (10 Мб- ға дейін) немесе қысқа MP4/ WebM бейнесі (бірінші кадр қолданылады) болуы мүмкін. Аудио файлы MP3, WAV, M4A немесе FLAC (10 Мб- ға дейін) болуы мүмкін. Аудио 16 кГц- ке дейін қайта дискреттеледі.

Тегін тіркелгілер: бір клипке 30 секундқа дейін. Ақылы тіркелгілер: бір сұранысқа 5 минутқа дейін. Ұзақ дыбыс ұзақ рендер уақыты мен қымбат символдармен байланысты.

Сөздерді қадамдастыру видеосы секундына 1000 таңбаны пайдаланады. 30 секундтық клипі = 30 таңба. Бұл ақы сіздің таңба балансыңыздан есептеледі және құрылу қатесі болса автоматты түрде қайтарылады.

No. The tool is switched off because the model license does not allow it. SadTalker code is Apache-2.0, but its bundled face reconstruction network was trained on the Basel Face Model 2009, whose license allows internal, non-commercial research only. Videos generated with it before September 15, 2026 are not for commercial use, paid plans included. You are responsible for having the rights to the source face image and audio you upload.

Құрал жұмыс істегенде, 5 секундтық клипі 30 секундқа созылды, дыбыс ұзындығымен шамамен сызықтық масштабта. Қазіргі таңда бұл мүмкіндік жоқ, біз бұл мүмкіндікті лицензиясы рұқсат ететін сөйлесу үстелі моделін іздеп жатырмыз.

Толық алдын- ала орнату (әдетті) ауызбен бірге бастың тұрысын, көз қимылдарын және жүзін де анимациялайды, бұл сөйлеп тұрған бас бейнесін табиғи етіп көрсетеді. Қалыпты алдын- ала орнату ауызды ғана анимациялап, басты бір орында ұстайды. Бұл тұрақты аватар түсіру үшін пайдалы.

GFPGAN - бұл рендерленгеннен кейін беттің егжей- тегжейін айқындап беретін бетті қалпына келтіру моделі. Бұл ұсынылмайды: оның StyleGAN2- сі NVIDIA коммерциялық емес лицензиясы бойынша, ал бетті талдау моделі CC BY- NC- SA лицензиясы бойынша.

SadTalker әдетті түрде 256 px, баяу 512 px режімде көрсетіледі. Бұл құрал қазір қол жетімді емес; жақсы жарықтандырылған, сапалы портрет кез келген сөйлеп тұрған бас моделімен ең жақсы нәтиже береді.

Иә. MP4 не WebM файлын беттің кірістіруі ретінде жүктеп беріңіз, біз бірінші кадрды жүргізуші ретінде қолданамыз. Толық бейнені қайта дубляждау (бір кадрдағы ауызды алмастыру) үшін Dubbing Studio- ның видео конвейерін қараңыз.

Иә. /api/v1/lipsync/ дегенге бет және аудио өрістерімен көпбөлік сұрауды POST жіберіп, содан кейін /api/v1/lipsync/result/?uuid= дегенге сұрау салып, күйі "completed" болып шығады. Жауапта бейнеленген MP4 файлының URL-і болады. API-ға қол жеткізу үшін төлемді жоспар қажет.

SadTalker ең көрнекті бетті анықтап, оны қиып алу үшін беттерді туралауды қолданады. Ең жақсы нәтижеге жету үшін бір адам ортаға қойылған, көзі көрінетін, көзі аздап жабық портретті жүктеп алыңыз. Топтық фотосуреттердің нәтижесі күтпеген болуы мүмкін.
5.0/5 (1)

Нені жақсартуға болады? Сіздің пікіріңіз бізге қателерді түзетуге көмектеседі.

Бастауға дайынсыз ба?

Тегін тіркеліңіз және 15,000 таңба алыңыз. Кредиттік карта қажет емес.