AI Lip Sync Video Generator

Drehen Sie ein Gesichtsfoto und einen Audioclip in ein Gesprächs-Kopf-Video mit Lippensynchronisation, Kopfpose und blinkt. Derzeit nicht verfügbar, während wir nach einem Modell suchen, dessen Lizenz es erlaubt.

Lip Sync ist momentan nicht verfügbar. Das verwendete SadTalker-Modell wurde am Basel Face Model ausgebildet, das nur für nichtkommerzielle Forschung lizenziert ist, so dass wir es nicht auf kostenpflichtigen Service anbieten können. Es ist noch kein Ersatz durch eine passende Lizenz installiert.

Face + Audio hochladen

1.000 Zeichen pro Sekunde

Drag & Drop Ihre Datei hier, oder durchsuchen

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

Datei.mp3

0 MB

Drag & Drop Ihre Datei hier, oder durchsuchen

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

Datei.mp3

0 MB

Verarbeitung...

Rendering Ihr Video. Dies dauert in der Regel 30 Sekunden bis 2 Minuten.

Ihr Gesprächskopf-Video

MP4 herunterladen

Über SadTalker

SadTalker (CVPR 2023, Tencent ARC) ist ein Open-Source-Gesprächskopfmodell, das ein einzelnes Gesichtsbild animiert, um jedes Audio zu sprechen. Im Gegensatz zu Wav2Lip-Varianten animiert SadTalker auch Kopfpose, Blinker und Ausdruck für ein natürlicheres Ergebnis.

SadTalkers Code ist Apache-2.0, aber seine 3D-Gesichtsrekonstruktionsgewichte wurden am Basel Face Model trainiert, dessen Lizenz nur nicht-kommerzielle Forschung erlaubt. TTS.ai ist ein kommerzieller Dienst, so dass das Tool am 15. September 2026 ausgeschaltet wurde.

Tipps für beste Ergebnisse

  • Verwenden Sie ein hochwertiges, gut beleuchtetes Porträt — Augen sichtbar, Mund geschlossen
  • Zentriertes Gesicht, quadratisch oder 4:5 Seitenverhältnis funktioniert am besten
  • Saubere Sprach-Audio (keine Musik) führt zu engeren Lippen-Synchronisation
  • GFPGAN für Helden-Aufnahmen aktivieren – Doppelt Renderzeit aber schärft Details
  • Verwenden Sie die Still Preset, wenn Sie eine stetige Avatar Schuss

Lip-Sync-Videopläne

Starten Sie kostenlos, aktualisieren Sie, wenn Sie mehr benötigen

Frei
  • 30-Sekunden-Audiolimit
  • 256 px Ausgang
  • Nur "noch" voreingestellt
  • Kein Gesichtsverstärker
Am beliebtesten
Kostenloses Konto
  • 30-Sekunden-Audiolimit
  • Sowohl "voll" als auch "noch" Presets
  • 256 / 512 px Ausgang
  • GFPGAN Gesichtsverstärker
Kostenlos anmelden
Pro
  • 5-Minuten-Audiolimit
  • Prioritäts-GPU-Warteschlange
  • API-Zugriff (Multipart Upload)
  • Webhook-Vervollständigung Rückrufe
  • Derzeit nicht verfügbar (nicht kommerzielle Modelllizenz)
Aktualisierung

Häufig gestellte Fragen

Laden Sie ein Gesichtsfoto und einen Audioclip hoch, und die KI generiert ein Video von diesem Gesicht, das das Audio mit Lippenbewegungen, Kopfpose und Blinken spricht. Das Tool ist derzeit nicht verfügbar: es lief SadTalker (CVPR 2023), dessen 3D-Gesichtsrekonstruktionsgewichte auf dem Basel Face Model, das nur für nichtkommerzielle Forschung lizenziert wurde, trainiert wurden.

Der Gesichtseingang kann ein JPG- oder PNG-Bild (bis zu 10 MB) oder ein kurzes MP4/WebM-Driving-Video sein (wir verwenden den ersten Frame). Das treibende Audio kann MP3, WAV, M4A oder FLAC bis zu 10 MB sein.

Kostenlose Konten: bis zu 30 Sekunden pro Clip. Bezahlende Benutzer: bis zu 5 Minuten pro Anfrage. Längere Audio bedeutet längere Renderzeit und höhere Zeichenkosten.

Lip-Sync-Video verwendet 1.000 Zeichen pro Sekunde des generierten Videos. Ein 30-Sekunden-Clip = 30.000 Zeichen. Die Kosten werden von Ihrem Charakter-Balance nach oben berechnet und automatisch zurückerstattet, wenn die Generierung fehlschlägt.

Nein. Das Tool ist ausgeschaltet, weil die Modelllizenz es nicht erlaubt. SadTalker-Code ist Apache-2.0, aber sein gebündeltes Face Reconstruction-Netzwerk wurde auf dem Basel Face Model 2009 trainiert, dessen Lizenz nur interne, nicht-kommerzielle Forschung erlaubt. Videos, die mit ihm vor dem 15. September 2026 generiert wurden, sind nicht für kommerzielle Zwecke, bezahlte Pläne enthalten. Sie sind verantwortlich für die Rechte an dem Quellgesichtbild und Audio, das Sie hochladen.

Als das Tool lief, dauerte ein 5-Sekunden-Clip etwa 30 Sekunden, wobei er grob linear mit Audiolänge skaliert wurde. Er ist derzeit nicht verfügbar, während wir nach einem Gesprächskopfmodell suchen, dessen Lizenz es erlaubt.

Volle Preset (Standard) animiert Kopfpose, blinkt, und Ausdruck zusammen mit den Lippen, die Herstellung eines natürlicher sprechenden Kopf-Video. Noch Preset sperrt den Kopf an Ort und Stelle und animiert nur den Mund – nützlich, wenn Sie eine stetige Avatar Aufnahme wollen.

GFPGAN ist ein Gesichtsrestaurationsmodell, das nach der Wiedergabe Gesichtsdetails schärferte. Es wird nicht angeboten: sein StyleGAN2 Prior steht unter einer nicht-kommerziellen NVIDIA-Lizenz und sein Gesichtsparsing-Modell ist CC BY-NC-SA.

SadTalker wird standardmäßig bei 256 px gerendert, mit 512 px als langsamerer Option. Das Tool ist derzeit nicht verfügbar; ein gut beleuchtetes, hochwertiges Portrait liefert das beste Ergebnis bei jedem Sprechkopfmodell.

Ja. Laden Sie einen MP4 oder WebM als Face-Input hoch und wir verwenden den ersten Frame als treibende Identität. Für vollständige Video-Redubbing (per-frame-Mund-Ersatz), siehe die bevorstehende Dubbing Studio Video-Pipeline.

Ja. POST eine mehrteilige Anfrage an /api/v1/lipsync/ mit Gesichts- und Audiofeldern, dann Umfrage /api/v1/lipsync/result/?uuid= bis Status "abgeschlossen" ist. Die Antwort enthält eine URL zum gerenderten MP4. API-Zugriff erfordert einen bezahlten Plan.

SadTalker verwendet Gesichtsausrichtung, um das prominenteste Gesicht zu erkennen und zu beschneiden. Für beste Ergebnisse, laden Sie ein Porträt mit einer Person zentriert, Augen sichtbar, und minimale Okklusion. Gruppenfotos können unvorhersehbare Ergebnisse zu produzieren.
5.0/5 (1)

Was könnten wir verbessern? Ihr Feedback hilft uns, Probleme zu beheben.

Bereit für den Anfang?

Melde dich kostenlos an und erhalte 15.000 Zeichen. Keine Kreditkarte erforderlich.