Lapor Pepijat / Permintaan Ciri

Penjana Video Segerakkan Lidah AI

Tukar foto muka dan klip audio ke video kepala bercakap dengan serasi bibir, pose kepala dan berkelip. Semasa ini tidak tersedia sementara kami mencari model yang lesennya membenarkannya.

Kami belum mempunyai suara TTS dalam bahasa anda. Bantu kami tambahkan suara anda! Jual Suara Anda
Segerakan bibir tidak tersedia sekarang. Model SadTalker yang digunakan telah dilatih pada Model Wajah Basel, yang dilesenkan untuk penyelidikan bukan komersial sahaja, jadi kami tidak boleh menawarkannya pada perkhidmatan berbayar. Tiada pengganti dengan lesen yang sesuai dipasang lagi.

Muat naik Face + Audio

1,000 aksara per saat

Seret dan lepaskan fail anda di sini, atau layari

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

fail.mp3

0 MB

Seret dan lepaskan fail anda di sini, atau layari

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

fail.mp3

0 MB

Memproses...

Menyalin video anda. Ini biasanya mengambil masa 30 saat hingga 2 minit.

Video Talking-Head anda

Perihal SadTalker

SadTalker (CVPR 2023, Tencent ARC) adalah model kepala bercakap sumber terbuka yang menganimisasikan imej wajah tunggal untuk bercakap sebarang audio. Tidak seperti varian Wav2Lip, SadTalker juga menganimisasikan pose kepala, berkelip, dan ekspresi untuk hasil yang lebih semulajadi.

Kod SadTalker adalah Apache-2.0, tetapi berat rekonstruksi wajah 3D telah dilatih pada Model Muka Basel, yang lesennya hanya membenarkan penyelidikan bukan komersial. TTS.ai adalah perkhidmatan komersial, jadi alat ini dimatikan pada 15 September 2026.

Panduan untuk Hasil Terbaik

  • Gunakan potret berkualiti tinggi, terang - mata kelihatan, mulut tertutup
  • Muka di tengah, persegi atau nisbah aspek 4:5 berfungsi dengan baik
  • Audio percakapan bersih (tiada muzik) menghasilkan penyegerakan bibir yang lebih ketat
  • Hidupkan GFPGAN untuk tembak hero - gandakan masa render tetapi pertingkatkan perincian
  • Guna praset Tetap bila anda mahukan gambar avatar yang stabil

Rencana Video Lip Sync

Mulakan percuma, naik taraf bila anda perlukan lebih

Bebas
  • Had audio 30 saat
  • Output 256 px
  • "Still" praset sahaja
  • Tiada penambah muka
Paling Popular
Akaun Bebas
  • Had audio 30 saat
  • Praset "penuh" dan "tak bergerak"
  • 256 / 512 px output
  • Peningkat muka GFPGAN
Daftar Masuk
Pro
  • Had audio 5 minit
  • Baris gilir GPU keutamaan
  • Capaian API (muat naik berbilang bahagian)
  • Panggilan balik penyelesaian Webhook
  • Semasa tidak tersedia (licen model bukan komersial)
Naik taraf

Soalan Lazim

Muat naik foto muka dan klip audio, dan AI menghasilkan video wajah itu bercakap audio dengan pergerakan bibir, pose kepala dan berkelip. Alat ini tidak tersedia: ia menjalankan SadTalker (CVPR 2023), yang berat rekonstruksi muka 3D dilatih pada Model Muka Basel, yang dilesenkan untuk penyelidikan bukan komersial sahaja.

Input wajah boleh menjadi imej JPG atau PNG (sehingga 10 MB) atau video MP4/WebM pendek (kami gunakan bingkai pertama). Audio boleh menjadi MP3, WAV, M4A, atau FLAC sehingga 10 MB. Kami sampel semula audio ke 16 kHz secara dalaman.

Akaun percuma: sehingga 30 saat setiap klip. Pengguna berbayar: sehingga 5 minit setiap permintaan. Audio lebih panjang bermakna masa render lebih lama dan kos aksara lebih tinggi.

Video penyegerakan bibir menggunakan 1,000 aksara per saat video yang dijana. Klip 30 saat = 30,000 aksara. Kos dicaj dari imbangan aksara anda dan dikembalikan secara automatik jika penjanaan gagal.

Tidak. Alat ini dimatikan kerana lesen model tidak membenarkannya. Kod SadTalker adalah Apache-2.0, tetapi rangkaian rekonstruksi wajah yang digabungkan telah dilatih pada Basel Face Model 2009, yang lesennya membenarkan hanya penyelidikan dalaman, bukan komersial. Video yang dijana dengannya sebelum 15 September 2026 tidak untuk penggunaan komersial, termasuk rancangan berbayar. Anda bertanggungjawab untuk mempunyai hak untuk imej wajah sumber dan audio yang anda muat naik.

Apabila alat berjalan, klip 5 saat mengambil masa kira-kira 30 saat, menyesuaikan secara linear dengan panjang audio. Ia tidak tersedia semasa kami mencari model kepala bercakap yang lesennya membenarkannya.

Praset penuh (piawai) menganimasikan pose kepala, berkelip, dan ekspresi bersama dengan bibir, menghasilkan video kepala bercakap yang lebih semulajadi. Praset tetap mengunci kepala di tempat dan menganimasikan hanya mulut - berguna bila anda mahukan tangkapan avatar yang stabil.

GFPGAN ialah model pemulihan wajah yang memperketatkan perincian wajah selepas merender. Ia tidak ditawarkan: StyleGAN2 terdahulunya adalah di bawah lesen NVIDIA bukan komersial dan model penghuraian wajahnya adalah CC BY-NC-SA.

SadTalker dirender pada 256 px secara default, dengan 512 px sebagai pilihan yang lebih perlahan. Alat ini tidak tersedia pada masa ini; potret berkualiti tinggi yang terang memberikan hasil terbaik dengan model kepala bercakap.

Ya. Muat naik MP4 atau WebM sebagai input muka dan kami akan menggunakan bingkai pertama sebagai identiti pemandu. Untuk penyuntingan semula video penuh (penggantian mulut per-bingkai), lihat paip video Studio penyuntingan yang akan datang.

Ya. POST permintaan berbilang bahagian ke /api/v1/lipsync/ dengan medan wajah dan audio, kemudian poll /api/v1/lipsync/result/?uuid= sehingga status adalah "selesai". Balasan mengandungi URL ke MP4 yang dirender. Akses API memerlukan rancangan berbayar.

SadTalker menggunakan jajaran muka untuk mengesan dan memotong muka yang paling ketara. Untuk hasil terbaik, muat naik potret dengan satu orang di tengah, mata kelihatan, dan oklusi minimum. Foto kumpulan mungkin menghasilkan hasil yang tidak dapat diramal.
5.0/5 (1)

Apa yang boleh kami perbaiki?

Sedia untuk mula?

Daftar percuma dan dapatkan 15,000 aksara. Tiada kad kredit diperlukan.