Báo cáo lỗi / yêu cầu tính năng

Tạo video đồng bộ môi AIName

Đổi ảnh mặt và đoạn nhạc thành video đầu nói với đồng bộ môi, tư thế đầu và nháy mắt. Hiện tại không có sẵn trong khi chúng tôi tìm kiếm một mô hình có giấy phép cho phép.

Hiện tại không có khả năng đồng bộ miệng. Mô hình SadTalker nó dùng đã được huấn luyện trên Mô hình Mặt Basel, được cấp phép chỉ cho nghiên cứu không thương mại, vì vậy chúng tôi không thể cung cấp nó trên một dịch vụ trả phí. Chưa có thay thế với một giấy phép phù hợp được cài đặt.

Tải lên

1000 ký tự mỗi giây

Kéo và thả tập tin vào đây, hoặc duyệt

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

file.mp3

0 MB

Kéo và thả tập tin vào đây, hoặc duyệt

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

file.mp3

0 MB

Đang xử lý...

Đang vẽ video. Thông thường mất 30 giây đến 2 phút.

Video Talking- Head của bạn

Tải về MP4

Về SadTalker

SadTalker (CVPR 2023, Tencent ARC) là một mô hình đầu nói nguồn mở mà làm sống động một hình ảnh mặt đơn để nói bất kỳ âm thanh nào.

Mã của SadTalker là Apache-2.0, nhưng trọng lượng tái tạo khuôn mặt 3D của nó được huấn luyện trên Basel Face Model, giấy phép của nó chỉ cho phép nghiên cứu không thương mại. TTS.ai là một dịch vụ thương mại, vì vậy công cụ đã bị tắt vào ngày 15 tháng 9 năm 2026.

Gợi ý cho kết quả tốt nhất

  • Dùng một chân dung chất lượng cao, ánh sáng tốt — mắt nhìn rõ, miệng đóng
  • Mặt ở giữa, hình vuông hoặc tỉ lệ 4: 5 hoạt động tốt nhất
  • Âm thanh nói sạch (không có nhạc) cho kết quả đồng bộ môi chặt hơn
  • Bật GFPGAN cho bắn anh hùng — tăng gấp đôi thời gian vẽ nhưng làm sắc nét chi tiết
  • Dùng mặc định Chụp khi muốn chụp hình nhân vật chụp chậm

Kế hoạch Video đồng bộ môiName

Bắt đầu miễn phí, nâng cấp khi cần nhiều hơn

Tự do
  • Giới hạn âm thanh 30 giây
  • Xuất 256 px
  • Chỉ mặc định "Still"
  • Không có tính năng tăng cường khuôn mặt
Nổi tiếng nhất
Tài khoản miễn phí
  • Giới hạn âm thanh 30 giây
  • Cả hai mặc định "full" và "still"
  • Xuất 256 / 512 px
  • Tăng cường khuôn mặt GFPGAN
Đăng ký miễn phí
Tốt
  • Giới hạn âm thanh 5 phút
  • Đang xếp hàng ưu tiên GPU
  • Truy cập API (tải lên nhiều phần)
  • Tìm kiếm
  • Hiện tại không có (giấy phép mẫu không thương mại)
Cập nhật

Câu hỏi thường gặp

Tải lên một bức ảnh mặt và một đoạn nhạc, và AI tạo ra một video của khuôn mặt đó nói âm thanh với chuyển động môi, tư thế đầu và nháy mắt. Công cụ hiện không có sẵn: nó chạy SadTalker (CVPR 2023), với trọng lượng tái tạo mặt 3D được huấn luyện trên Basel Face Model, được cấp phép chỉ cho nghiên cứu không thương mại.

Đầu vào mặt có thể là một hình ảnh JPG hoặc PNG (đến 10 MB) hoặc một video lái xe MP4/ WebM ngắn (chúng tôi dùng khung đầu tiên). Âm thanh lái xe có thể là MP3, WAV, M4A, hoặc FLAC lên đến 10 MB. Chúng tôi lấy mẫu lại âm thanh đến 16 kHz bên trong.

Tài khoản miễn phí: lên đến 30 giây mỗi đoạn. Người dùng trả tiền: lên đến 5 phút mỗi yêu cầu. Âm thanh dài hơn có nghĩa là thời gian vẽ dài hơn và chi phí nhân vật cao hơn.

Đoạn phim đồng bộ miệng sử dụng 1.000 ký tự mỗi giây của đoạn phim được tạo ra. Một đoạn phim 30 giây = 30.000 ký tự. Chi phí được tính trước từ số ký tự còn lại của bạn và được hoàn lại tự động nếu tạo ra thất bại.

No. The tool is switched off because the model license does not allow it. SadTalker code is Apache-2.0, but its bundled face reconstruction network was trained on the Basel Face Model 2009, whose license allows internal, non-commercial research only. Videos generated with it before September 15, 2026 are not for commercial use, paid plans included. You are responsible for having the rights to the source face image and audio you upload.

Khi công cụ chạy, một đoạn phim 5 giây mất khoảng 30 giây, tăng dần theo đường thẳng với độ dài âm thanh. Hiện tại nó không có sẵn trong khi chúng tôi đang tìm kiếm một mô hình đầu nói có giấy phép cho phép nó.

Mặc định đầy đủ (mặc định) tạo động đầu, nháy mắt, và biểu cảm cùng với môi, tạo ra một đoạn phim đầu nói tự nhiên hơn. Mặc định vẫn giữ đầu ở vị trí và chỉ tạo động miệng — hữu ích khi bạn muốn chụp hình nhân vật ổn định.

GFPGAN là một mô hình phục hồi khuôn mặt làm sắc nét các chi tiết khuôn mặt sau khi vẽ. Nó không được cung cấp: StyleGAN2 trước đó của nó là dưới giấy phép không thương mại NVIDIA và mô hình phân tích khuôn mặt của nó là CC BY-NC-SA.

SadTalker được vẽ ở 256 px mặc định, với 512 px là tùy chọn chậm hơn. Công cụ này hiện không có sẵn; một bức chân dung sáng và chất lượng cao sẽ cho kết quả tốt nhất với bất kỳ mô hình đầu nói nào.

Có. Tải lên một MP4 hoặc WebM như là đầu vào khuôn mặt và chúng tôi sẽ dùng khung đầu tiên như là bản sao lái. Để xem lồng tiếng lại video đầy đủ (thay thế miệng mỗi khung), xem ống dẫn video sắp tới của Dubbing Studio.

Đúng. POST một yêu cầu đa phần đến /api/v1/lipsync/ với các trường mặt và âm thanh, sau đó hỏi /api/v1/lipsync/result/?uuid= cho đến khi trạng thái là "đã hoàn thành". Phản hồi chứa một URL đến MP4 được hiển thị. Truy cập API yêu cầu một gói trả phí.

SadTalker dùng sự đối xứng khuôn mặt để phát hiện và cắt khuôn mặt nổi bật nhất. Để có kết quả tốt nhất, tải lên một chân dung với một người ở giữa, mắt nhìn thấy, và tối thiểu bị che khuất. Những bức ảnh nhóm có thể tạo ra kết quả không thể đoán trước.
5.0/5 (1)

Chúng tôi có thể cải thiện gì? phản hồi của bạn giúp chúng tôi khắc phục vấn đề.

Sẵn sàng bắt đầu chưa?

Đăng ký miễn phí và nhận 50 điểm. Không cần thẻ tín dụng.