AI Lip Sync Video Generator

Putar foto wajah dan klip audio ke dalam video yang berbicara dengan lip sync, pose kepala dan berkedip. Saat ini tidak tersedia saat kita mencari model yang lisensinya memungkinkan.

Kami belum memiliki suara TTS dalam bahasamu. Juallah Suara Anda
Lip sync tidak tersedia sekarang. Model SadTalker yang digunakan dilatih pada Model Muka Basel, yang dilisensikan untuk penelitian non-komersial saja, jadi kita tidak bisa menawarkannya pada layanan yang dibayar. Tidak ada pengganti dengan lisensi yang cocok yang terpasang belum.

Unggah Face + Audio

1.000 karakter per detik

Seret & jatuhkan berkas anda di sini, atau ramban

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

berkas.mp3

0 MB

Seret & jatuhkan berkas anda di sini, atau ramban

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

berkas.mp3

0 MB

Memproses...

Mengalihkan video Anda ini biasanya memakan waktu 30 detik sampai 2 menit.

Video Kepala Bicara Anda

Unduh MP4

Tentang SadTalker

SadTalker (CVPR 2023, Tencent ARC) adalah model berbicara-sumber terbuka-kepala yang menghidupkan gambar wajah tunggal untuk berbicara audio apapun. Tidak seperti varian Wav2Lip, Sad Talker juga animate head pose, berkedip, dan ekspresi untuk hasil yang lebih alami.

Kode SadTalker adalah Apache-2.0, tapi 3D berat rekonstruksi wajah dilatih pada Model Muka Basel, yang lisensi memungkinkan non-komersial penelitian saja. TTS.ai adalah layanan komersial, jadi alat itu dimatikan pada 15 September 2026.

Tip untuk Hasil - Hasil Terbaik

  • Gunakan kualitas tinggi, potret yang terang baik. Mata terlihat, mulut tertutup.
  • Wajah tengah, rasio persegi atau 4:5 aspek bekerja terbaik
  • Audio pidato bersih (tanpa musik) menghasilkan lip sync ketat
  • Aktifkan GFPGAN untuk tembakan pahlawan ı doubles render waktu tetapi menajamkan detail
  • Gunakan Masih preset ketika Anda ingin tembakan avatar stabil

Lip Sync Video Plans

Mulai bebas, upgrade ketika Anda membutuhkan lebih banyak

Bebas
  • Batas audio 30 detik
  • Keluaran 256 px
  • "Masih" preset saja
  • Tidak ada penambah wajah
Paling Populer
Akun Bebas
  • Batas audio 30 detik
  • Keduanya "penuh" dan "masih" preset
  • 256 / 512 px output
  • Penambah wajah GFPGAN
Daftar Bebas
Pro
  • Batas audio 5 menit
  • Antrian GPU prioritas
  • Akses API (multipart upload)
  • Pemanggilan pelengkapan webhook
  • Saat ini tidak tersedia (tidak ada lisensi model commercial)
Tingkatkan

Pertanyaan yang Sering Diajukan

Mengunggah foto wajah dan klip audio, dan AI menghasilkan video wajah yang berbicara dengan gerakan bibir, pose kepala dan berkedip. Alat ini saat ini tidak tersedia: menjalankan SadTalker (CVPR 2023), yang 3D menghadapi rekonstruksi berat yang dilatih pada Model Muka Basel, yang dilisensikan untuk penelitian non-komersial saja.

Masukan wajah dapat berupa gambar JPG atau PNG (naik sampai 10 MB) atau video penggerak MP4/WebM pendek (kita menggunakan bingkai pertama). Audio mengemudi dapat MP3, WAV, M4A, atau FLAC hingga 10 MB. Kami mengulang audio ke 16 kHz secara internal.

Akun bebas: hingga 30 detik per klip. Membayar pengguna: hingga 5 menit per permintaan. Audio lebih panjang berarti render waktu dan biaya karakter yang lebih tinggi.

Lip sync video menggunakan 1.000 karakter per detik dari video yang dihasilkan. Klip 30 detik = 30.000 karakter. Biaya ditagih di depan dari keseimbangan karakter Anda dan dikembalikan secara otomatis jika generasi gagal.

No. Alat dimatikan karena lisensi model tidak mengijinkannya. Kode SadTalker adalah Apache-2.0, tapi jaringan rekonstruksi wajah yang dibalutnya dilatih pada Model Wajah Basel 2009, yang lisensinya hanya memungkinkan penelitian internal, non-kommersial. Video yang dihasilkan dengannya sebelum 15 September 2026 tidak untuk penggunaan komersial, termasuk rencana yang dibayar. Anda bertanggung jawab untuk memiliki hak-hak untuk gambar wajah sumber dan audio upload.

Ketika alat berjalan, klip 5 detik memakan waktu sekitar 30 detik, skala kira-kira linier dengan panjang audio. Saat ini tidak tersedia saat kita mencari model kepala-bicara yang lisensinya mengijinkan.

Praset penuh (default) animates head pose, blinks, and expression along with the lips, production a more natural talking-head video.

GFPGAN adalah model restorasi wajah yang mempertajam rincian wajah setelah render. Ini tidak ditawarkan: Styangan2 sebelumnya berada di bawah lisensi NVIDIA non-komersial dan wajah parsing model CC BY-NC-SA.

SadTalker dirender pada 256 px secara baku, dengan 512 px sebagai opsi lambat. Alat saat ini tidak tersedia; potret berkualitas tinggi memberikan hasil terbaik dengan model kepala-bicara apapun.

Mengunggah MP4 atau WebM sebagai masukan wajah dan kita akan menggunakan frame pertama sebagai identitas mengemudi. Untuk video yang diredubbing penuh (per-frame mulut pengganti), lihat pipa Dubbing Studio mendatang.

Ya. POST permintaan multipart untuk /api/v1/lipsync/ dengan bidang wajah dan audio, kemudian jajak pendapat /api/v1/lipsync/result/?uid= sampai status "selesai". Responnya berisi URL ke akses MP4 yang dirender API membutuhkan rencana yang dibayar.

SadTalker menggunakan pengenalan wajah untuk mendeteksi dan memanen wajah yang paling menonjol. Untuk hasil terbaik, upload potret dengan satu orang berpusat, mata terlihat, dan minimal okklusion. Foto grup mungkin menghasilkan hasil yang tak terduga.
5.0/5 (1)

Umpan balikmu membantu kita memperbaiki masalah.

Siap untuk memulai?

Daftar gratis dan mendapatkan 15.000 karakter Tidak ada kartu kredit yang diperlukan.