AI Lip同步视频生成器

将脸部照片和音频片转换成口语头部视频,同时用嘴唇同步、头部姿势和眨眼。 目前我们无法在寻找许可证允许的模型时使用。

使用时使用的SadTalker模型是用巴塞尔脸模型培训的,该模型仅获得非商业研究许可,因此我们不能提供付费服务。 目前还没有安装合适的许可证替换软件。

上传 face + 音频

每秒1,000个字符

拖放您的文件到这里( D), 或者 浏览

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

文件. mp3

0 MB

拖放您的文件到这里( D), 或者 浏览

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

文件. mp3

0 MB

处理...

制作视频 通常需要30秒到2分钟

你的说话头视频

下载 MP4

关于赛德多克的故事,

SadTalker (CVPR 2023, Tencent ARC) 是一个开放源码口语头模型,它能动画一个单张脸像来播放任何音频。 与Wav2Lip变体不同,SadTalker还动画头部姿势、眨眼和表达更自然的结果。

SadTalker's code is Apache-2.0, but its 3D face reconstruction weights were trained on the Basel Face Model, whose license allows non-commercial research only. TTS.ai is a commercial service, so the tool was switched off on September 15, 2026.

最佳成果提示

  • 使用高质量、利利的肖像——目视、闭嘴、闭嘴
  • 中心面部、正方或4:5或4:5的方位比率最有效
  • 清洁言语音响( 没有音乐) 使嘴唇同步更紧
  • 启用 GFPPGAN 来拍摄英雄镜头—— 双倍让时间变长, 细化
  • 想要稳步阿凡达拍摄时使用“静态预设”

Lipc 视频同步计划

开始免费, 需要时升级

自由
  • 30秒音频限制
  • 256 px 输出
  • 仅“ 仍然” 预设
  • 无面容增强器
最受欢迎的
自由帐户
  • 30秒音频限制
  • "满"和"还"的预设
  • 256/512 px 输出
  • GGGPPAN 增强脸部
签署自由
职业
  • 5分钟音频限制
  • 优先的 GPU 队列
  • API 访问(多部分上传)
  • WebHook 完成回调
  • 目前无法使用(非商业许可证范本)
升级

常问问题

AI制作了一个视频,用嘴唇运动、头部姿势和眨眼来表达这张脸。 目前该工具无法使用:它运行着SadTalker(CVPR 2023), 其3D面部重建重量在《巴塞尔脸模型》上接受了培训,而该模型仅获得非商业研究许可。

面部输入可以是 JPG 或 PNG 图像( 最多 10 MB) 或 简短的 MP4/ WebM 驱动视频( 我们使用第一个框架 ) 。 驱动音频可以是 MP3 、 WAV、 M4A 或 FLAC, 最多 10 MB 。 我们内部将音频复制到 16 kHz 。

自由帐户: 每个剪辑最多30秒。 支付用户: 每个请求最多5分钟。 音频越长, 意味着时间越长, 字符费用就越高 。

Lip同步视频使用每秒生成的视频1,000个字符。 30秒的剪辑 = 30,000个字符。 成本从您的字符平衡帐面上提取帐单, 如果生成失败, 自动退款 。

否。 工具被关闭是因为许可证范本不允许使用。 SadTalker代码是 Apache-2.0, 但其捆绑的面部重建网络是用2009年巴塞尔脸模型培训的, 其许可证只允许内部的非商业研究。 2026年9月15日之前制作的视频不用于商业用途, 包括付费计划。 您负责对源面图像和您上传的音频进行权利。

当工具运行时,一个5秒的剪辑用了大约30秒,以音频长度粗略的线性缩放。 目前无法使用,我们寻找一个有许可证的口语头型模型。

完全预设(默认)头部姿势、眨眼和表情与嘴唇一起制作一个更自然的说话头部视频。 仍然预设头部固定位置,只动动口动脉 — — 当你想要稳健的阿凡达射手时有用。

GFPGAN是一种面部恢复模型,在制作后会磨焦面部细节,但并未提供:StelegGAN2公司以前是持NVIDIA非商业许可证的,其面部解析模型是CC BY-NC-SA。

萨达克( SadTalker) 默认以 256 px 制成, 512 px 是一个较慢的选择。 该工具目前无法使用; 高品质的高质量光亮肖像可以给任何口语头模型带来最佳效果 。

是的 。 上传 MP4 或 WebM 作为脸部输入, 我们将使用第一个框架作为驱动身份 。 完整视频重拍( 每框架的嘴部替换) 请看 Dubbing 工作室即将到来的视频管道 。

是。 POST 对 /api/ v1/lipsync 的多部分请求 / api/ v1/lipsync / 包含脸和音频字段, 然后对 opol / api/ v1/lipsync/ result/? uuid = 直到状态“ 完成 ” 。 回复包含完成 MP4 的 URL 。 API 访问需要付费计划 。

萨达克(Sadalker)使用面部对齐来探测和裁剪最突出的面孔。 为了取得最佳效果,上传一张画像,以一个人为中心,眼睛可见,最小的隐蔽。 群体照片可能会产生无法预测的结果 。
5.0/5 (1)

我们能改进什么?您的反馈帮助我们解决问题。

准备好开始了吗?

免费报名并获得50张信用卡,不需要信用卡。