バグ/機能要求を報告

人工唇同期ビデオ生成器

顔写真とオーディオクリップを唇同期、頭のポーズ、瞬きを持つ話し頭ビデオに変換します。ライセンスが許可するモデルを探している間は現在利用できません。

リップシンクは現在利用できません。 SadTalker モデルは Basel Face Model で訓練されました。 Basel Face Model は非商用研究のみのライセンスです。有料サービスでは提供できません。適切なライセンスで置き換えられたものはまだインストールされていません。

顔とオーディオをアップロード

1000文字/秒

ファイルをここにドラッグ&ドロップするか、 ブラウズ

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

ファイル.mp3

0 MB

ファイルをここにドラッグ&ドロップするか、 ブラウズ

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

ファイル.mp3

0 MB

処理中...

動画をレンダリングしています。通常 30 秒から 2 分かかります。

ユア・トークンヘッド・ビデオ

サドトーカー

SadTalker(CVPR 2023, Tencent ARC)は、単一の顔画像をアニメーション化して、どんな音声でも話すオープンソースの話し頭モデルである。Wav2Lipの変種とは異なり、SadTalkerは頭の姿勢、瞬き、表情をアニメーション化することで、より自然な結果を得る。

SadTalker's code is Apache-2.0, but its 3D face reconstruction weights were trained on the Basel Face Model, whose license allows non-commercial research only. TTS.ai is a commercial service, so the tool was switched off on September 15, 2026.

最高の結果を得るためのヒント

  • 高品質で明るい肖像画を使う - 目が見える、口が閉じている
  • 中心に面、四角または 4:5 のアスペクト比が最適です
  • 音声をクリアにすると (音楽なし) 唇同期が良くなります
  • ヒーローショットの GFPGAN を有効にする - レンダリング時間を倍にするが、詳細を鋭くする
  • アバターの写真を静止画にしたい場合は、静止画プレセットを使用します

リップシンク

無料で始め、必要に応じてアップグレード

自由
  • 30秒音声制限
  • 256 px 出力
  • プリセットのみ
  • 顔のエンハンサーなし
最も人気のある
無料アカウント
  • 30秒音声制限
  • "フル" と "スティック" の両方のプリセット
  • 256 / 512 px 出力
  • GFPGAN顔エンハンサー
無料登録
プロ
  • 5分音声制限
  • 優先度GPUキュー
  • API アクセス (多重アップロード)
  • ウェブフック完了コールバック
  • 現在は利用できない(非商用モデルライセンス)
アップグレード

よくある質問

顔写真と音声クリップをアップロードすると、AIはその顔のビデオを生成し、唇の動き、頭のポーズ、瞬きなどで音声を話す。このツールは現在利用できません。 SadTalker (CVPR 2023) を実行しました。3D顔再構築重量は、非商用研究のみのライセンスである Basel Face Model で訓練されています。

顔の入力は JPG または PNG 画像 (最大 10MB) または短い MP4/WebM ドライビングビデオ (最初のフレームを使用) です。ドライビング音声は MP3、WAV、M4A、FLAC で最大 10MB です。音声は内部で 16kHz にリサンプリングします。

無料アカウント: クリップ当たり最大 30 秒。有料ユーザ: 要求当たり最大 5 分。長いオーディオは長いレンダリング時間と高い文字コストを意味します。

リップシンクビデオは生成されたビデオの 1 秒あたり 1,000 文字を使用します。30 秒のクリップ = 30,000 文字。コストは文字残高から前もって請求され、生成に失敗した場合は自動的に返金されます。

いいえ、モデルライセンスが許可しないため、このツールは無効にされています。 SadTalker のコードは Apache-2.0 ですが、そのバンドルされた顔再構築ネットワークは Basel Face Model 2009 で訓練され、そのライセンスは内部の非商業的な研究のみを許可します。 2026年9月15日以前に生成されたビデオは、有料プランを含めて商業的な使用は許可されません。アップロードしたソースの顔画像とオーディオの権利を持つ責任はあなたにあります。

このツールを実行したとき、5秒のクリップは約30秒かかり、音声の長さとほぼ線形にスケールしました。ライセンスが許可する話しヘッドモデルを探している間、このツールは現在利用できません。

完全プリセット (デフォルト) は、頭のポーズ、瞬き、表情を唇と共にアニメーションし、より自然な話し頭のビデオを生成します。 静止プリセットは、頭をその場所に固定し、口のみをアニメーションします。安定したアバターショットを望むときに役立ちます。

GFPGANはレンダリング後に顔の詳細を鋭くする顔復元モデルです。その StyleGAN2 プリエーリは NVIDIA の非商用ライセンスの下であり、顔解析モデルは CC BY-NC-SA であるため、提供されていません。

SadTalker は標準で 256 px で表示され、遅いオプションとして 512 px が使用できます。このツールは現在利用できません。 明るく高品質なポートレート画像は、どの話し頭モデルでも最良の結果を与えます。

はい。顔入力として MP4 または WebM をアップロードしてください。最初のフレームを運転者のアイデンティティとして使用します。完全なビデオ再ダビング(フレームごとの口の置き換え)については、次に公開される Dubbing Studio ビデオパイプラインを参照してください。

はい。顔と音声フィールドを含むマルチパートリクエストを /api/v1/lipsync/ に POST し、状態が "completed" になるまで /api/v1/lipsync/result/?uuid= をポールします。応答にはレンダリングされた MP4 の URL が含まれます。API アクセスには有料プランが必要です。

SadTalker は顔の配列を使って最も目立つ顔を検出し、カットします。最良の結果を得るには、1 人の人物を中心に、目が見えるように、最小限の遮蔽を持つ肖像画をアップロードしてください。グループ写真は予測できない結果を生み出す可能性があります。
5.0/5 (1)

改善点は何ですか?フィードバックは問題を解決するのに役立ちます。

準備はいいか?

クレジットカードは必要ありません