เครื่องสร้างวิดีโอปรับแต่งลิ้นแบบ AI

เปลี่ยนรูปหน้าและคลิปเสียง เป็นวิดีโอหัวพูด ด้วยการปรับปรุงริมฝีปาก ท่าหัว และการกระพริบตา ตอนนี้ไม่สามารถใช้ได้ ขณะที่เรากำลังมองหา โมเดลที่ใบอนุญาตอนุญาตให้ใช้

เรายังไม่มีเสียง TTS ในภาษาของคุณ ช่วยเราเพิ่มเสียงของคุณด้วย! ขายเสียงของคุณ
ตอนนี้ยังไม่สามารถใช้การปรับปรุงลิ้นได้ โมเดล SadTalker ที่ใช้ได้ถูกฝึกมาจากโมเดลหน้า Basel ซึ่งมีลิขสิทธิ์เฉพาะสำหรับการวิจัยที่ไม่เป็นทางการเท่านั้น ดังนั้นเราจึงไม่สามารถเสนอบริการนี้ในราคาที่จ่ายได้ ยังไม่มีการติดตั้งลิขสิทธิ์ที่เหมาะสม

โหลดหน้า + เสียง

1,000 อักขระต่อวินาที

ลากและวางแฟ้มของคุณที่นี่ หรือ แสดงหน้าต่าง

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

แฟ้ม.mp3

0 MB

ลากและวางแฟ้มของคุณที่นี่ หรือ แสดงหน้าต่าง

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

แฟ้ม.mp3

0 MB

กำลังประมวลผล...

กำลังแสดงวิดีโอของคุณ โดยทั่วไปจะใช้เวลา 30 วินาทีถึง2นาที

วิดีโอหัวพูดของคุณ

ดาวน์โหลด

เกี่ยวกับ SadTalker

SadTalker (CVPR 2023, Tencent ARC) เป็นโมเดลหัวพูดแบบโอเพนซอร์สที่ทำการเคลื่อนไหวภาพใบหน้าเดียวเพื่อพูดเสียงใด ๆ ไม่เหมือนกับแปรรูป Wav2Lip, SadTalker ยังทำการเคลื่อนไหวท่าทางหัว, กระพริบตา, และสีหน้าเพื่อผลลัพธ์ที่ธรรมชาติกว่า

โค้ดของ SadTalker คือ Apache-2.0 แต่การสร้างหน้า3มิติของมัน ถูกฝึกบน Basel Face Model ซึ่งใบอนุญาตของมัน อนุญาตให้ทำการวิจัย แบบไม่พึ่งพาการค้าเท่านั้น TTS.ai เป็นบริการทางการค้า ดังนั้นเครื่องมือจึงถูกปิดในวันที่ 15 กันยายน 2026

ข้อแนะนำสำหรับผลลัพธ์ที่ดีที่สุด

  • ใช้ภาพถ่ายรูปภาพบุคคลที่มีคุณภาพสูง แสงสว่างดี - ตาเห็นได้ ปากปิด
  • หน้าที่อยู่กลาง, สีสี่เหลี่ยม หรือ อัตราส่วนหน้าจอ 4:5 เหมาะสมที่สุด
  • เสียงพูดที่สะอาด (ไม่มีดนตรี) ทำให้การปรับปรุงเสียงเรียบง่ายขึ้น
  • เปิดใช้ GFPGAN สำหรับภาพถ่ายฮีโร่ - เพิ่มเวลาแสดงผลเป็นสองเท่า แต่เพิ่มรายละเอียดให้คมชัด
  • ใช้ตัวเลือกตั้งค่าก่อนหน้านี้ สำหรับภาพถ่ายภาพถ่ายอวตารที่ไม่เปลี่ยนแปลง

วางแผนการถ่ายวิดีโอด้วยการปรับสมดุลลิปName

เริ่มฟรี ปรับปรุงเมื่อคุณต้องการมากกว่านี้

ว่าง
  • ขอบเขตเสียง 30 วินาที
  • ข้อมูลออกมาเป็น 256 จุดต่อนิ้ว
  • ตั้งค่าก่อนใช้งาน "Still" เท่านั้น
  • ไม่มีการปรับแต่งใบหน้า
ยอดนิยมที่สุด
บัญชีผู้ใช้ที่ว่าง
  • ขอบเขตเสียง 30 วินาที
  • ตั้งค่าก่อนใช้งานทั้ง "เต็ม" และ "หยุด"
  • ข้อมูลออกมา 256 / 512 จุดต่อนิ้ว
  • ตัวเสริมหน้า GFPGAN
ลงทะเบียน
โปร
  • จำกัดเสียง5นาที
  • ความสำคัญของคิว GPU
  • เข้าถึง API (อัปโหลดหลายส่วน)
  • เรียกกลับการเสร็จสิ้นของ Webhook
  • ปัจจุบันไม่มีให้ใช้ (ใบอนุญาตแบบจำลองที่ไม่ใช้ในเชิงพาณิชย์)
ปรับระดับ

คำถามที่ถามบ่อย

โหลดรูปหน้าและคลิปเสียง และ AI จะสร้างวิดีโอของหน้านั้น พูดเสียงด้วยการเคลื่อนไหวริมฝีปาก ท่าทางหัว และจิ้มตา เครื่องมือนี้ไม่สามารถใช้งานได้ในขณะนี้: มันทำงาน SadTalker (CVPR 2023) ซึ่งเป็นน้ำหนักการสร้างหน้า3มิติที่ถูกฝึกบน Basel Face Model ซึ่งมีลิขสิทธิ์สำหรับการศึกษาวิจัยที่ไม่ใช่ทางการค้าเท่านั้น

ข้อมูลเข้าทางใบหน้าสามารถเป็นรูป JPG หรือ PNG (ขนาดสูงสุด 10 MB) หรือวิดีโอขับขี่ MP4/WebM สักระยะ (เราใช้เฟรมแรก) เสียงขับขี่สามารถเป็น MP3, WAV, M4A หรือ FLAC ขนาดสูงสุด 10 MB เราจะรีเซ็ปต์เสียงเป็น 16 kHz ภายใน

บัญชีผู้ใช้ฟรี: สูงสุด 30 วินาทีต่อคลิป ส่วนผู้ใช้จ่าย: สูงสุด5นาทีต่อคำร้อง เสียงยิ่งยาว ยิ่งใช้เวลาในการแสดงผลยิ่งนาน และค่าตัวอักษรก็ยิ่งสูง

วิดีโอ Lip Sync ใช้ 1,000 ตัวอักษรต่อวินาทีของวิดีโอที่สร้างขึ้น คลิป 30 วินาที = 30,000 ตัวอักษร ค่าใช้จ่ายจะถูกเรียกเก็บก่อนหน้านี้จากสภาพตัวอักษรของคุณ และจะคืนเงินให้โดยอัตโนมัติหากการสร้างล้มเหลว

ไม่ใช่ เครื่องมือนี้ถูกปิด เพราะว่า ใบอนุญาตแบบจำลองไม่อนุญาตให้ใช้ โค้ดของ SadTalker คือ Apache-2.0 แต่เครือข่ายการสร้างหน้าใหม่ที่รวมอยู่ในบรรจุภัณฑ์นั้น ถูกฝึกมาจาก Basel Face Model 2009 ซึ่งใบอนุญาตของมัน อนุญาตให้ใช้ภายใน ไม่ใช่เพื่อการวิจัยทางการค้าเท่านั้น วิดีโอที่สร้างขึ้นด้วยมันก่อนวันที่ 15 กันยายน 2026 ไม่ได้ใช้เพื่อการค้า ไม่มีแผนจ่ายเงิน คุณต้องรับผิดชอบในการมีสิทธิ์ในรูปภาพหน้าและเสียงที่คุณอัพโหลด

ตอนที่เครื่องมือทำงาน คลิป5วินาทีใช้เวลาประมาณ 30 วินาที ปรับขนาดได้ตามความยาวของเสียง ปัจจุบันไม่มีเครื่องมือนี้อยู่ ขณะที่เรากำลังค้นหาโมเดลหัวพูดที่ใบอนุญาตอนุญาตให้ใช้

ตั้งค่าแบบเต็ม (ปริยาย) จะทำการเคลื่อนไหวของตำแหน่งหัว กระพริบตา และสีหน้าพร้อมกับริมฝีปาก ทำให้เกิดภาพวิดีโอที่พูดได้เหมือนจริงมากขึ้น ตั้งค่าแบบยืนยัน จะล็อคหัวไว้ในตำแหน่งเดิม และทำการเคลื่อนไหวเพียงปากเท่านั้น - เหมาะกับการถ่ายภาพอวตารที่คงที่

GFPGAN เป็นโมเดลการฟื้นฟูหน้าที่ทำให้รายละเอียดของหน้าดูชัดขึ้นหลังจากการแสดงผล มันไม่ได้ถูกเสนอ: StyleGAN2 ของมันก่อนหน้านี้อยู่ภายใต้ใบอนุญาต NVIDIA ไม่เป็นทางการ และโมเดลการวิเคราะห์หน้าของมันอยู่ภายใต้ CC BY-NC-SA

ตัว SadTalker แสดงผลที่ 256 พิกเซลโดยปริยาย โดยมีตัวเลือกที่ช้ากว่า 512 พิกเซล ปัจจุบันเครื่องมือนี้ยังไม่สามารถใช้งานได้ ภาพถ่ายรูปหน้าผากที่มีคุณภาพสูงและแสงสว่างจะให้ผลลัพธ์ที่ดีที่สุดกับตัวอย่างหัวพูด

ใช่ โหลด MP4 หรือ WebM เป็นข้อมูลเข้าทางใบหน้า และเราจะใช้เฟรมแรกเป็นตัวตนในการขับขี่ สำหรับการดัดเสียงวิดีโอเต็มรูปแบบ (การเปลี่ยนปากต่อเฟรม) โปรดดูท่อวิดีโอ Dubbing Studio ที่กำลังจะมาถึง

ใช่ ทำการ POST คำขอหลายส่วนไปยัง /api/v1/lipsync/ พร้อมกับช่องข้อมูลหน้าและเสียง จากนั้นโพลล์ /api/v1/lipsync/result/?uuid= จนกว่าสถานะจะ "เสร็จสิ้น" การตอบรับจะประกอบด้วย URL ของ MP4 ที่แสดงผล ในการเข้าถึง API จำเป็นต้องใช้แพ็คเกจที่จ่ายเงิน

SadTalker ใช้การจัดเรียงใบหน้าเพื่อตรวจจับและตัดภาพใบหน้าที่โดดเด่นที่สุด หากต้องการผลลัพธ์ที่ดีที่สุด ให้อัปโหลดภาพถ่ายรูปคนที่อยู่ตรงกลาง ตาเห็นได้ และมีรอยแผลเป็นน้อยที่สุด ภาพกลุ่มอาจจะทำให้เกิดผลลัพธ์ที่ไม่คาดคิดได้
5.0/5 (1)

เราจะปรับปรุงอะไรได้บ้าง ความคิดเห็นของคุณช่วยเราแก้ไขปัญหา

พร้อมจะเริ่มไหม?

ลงทะเบียนฟรีและได้รับ 50 เครดิต ไม่จำเป็นต้องใช้บัตรเครดิต