Bug / Feature Request mellen

AI Lip Sync Videogenerator

Verwandelt eng Gesiichtsfoto an en Audioclip an e Video mat engem schwätzenden Kopf mat Lipsync, Kopfpositioun a Bléck. Momentan net verfügbar, well mir no engem Modell sichen, dat dat erlaabt.

Mir maachen dat D'Stëmm vum Mënsch
Lip Sync ass derzäit net verfügbar. De SadTalker-Modell deen et benotzt huet, gouf op dem Basel Face Model trainéiert, deen nëmmen fir net-kommerziell Fuerschung lizenzéiert ass, sou datt mir et net op engem bezuelte Service ubidden. Et ass nach kee Ersatz mat enger passender Lizenz installéiert.

Audio

1000 Zeichen pro Sekonn

Ziehen a léisen Är Datei hei, oder Sich

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

Datei.mp3

0 MB

Ziehen a léisen Är Datei hei, oder Sich

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

Datei.mp3

0 MB

Veraarbechtung...

Äert Video gëtt gerendert. Dat dauert normalerweis 30 Sekonnen bis 2 Minutten.

Websäit vum Video

Erofgelueden

Websäit vum Saarland

De SadTalker (CVPR 2023, Tencent ARC) ass en Open-Source-Modell, deen e Gesiicht animéiert fir all Audio ze schwätzen. Am Géigesaz zu Wav2Lip-Varianten animéiert SadTalker och Kopfpositiounen, Bléckwiessel an Ausdréck fir e méi natierlecht Resultat.

SadTalker's code is Apache-2.0, but its 3D face reconstruction weights were trained on the Basel Face Model, whose license allows non-commercial research only. TTS.ai is a commercial service, so the tool was switched off on September 15, 2026.

Tipps fir déi bescht Resultater

  • Benotzt e gutt beliichte Porträt mat héijer Qualitéit - Aen sichtbar, Mond geschloss
  • Zentréiert Gesiicht, Quadrat oder 4:5 Säitenverhältnes funktionnéiert am Beschten
  • D'Sprooch ass net méi am Gebrauch, d'Musek ass méi räich un Texter.
  • GFPGAN fir Helden-Schëss aktivéieren - verdoppelt d'Renderzäit, awer verschärft d'Detailer
  • Benotzt d'Standbild-Vireinstellung wann Dir e stännege Avatar-Schnappschuss wëllt

Websäit vu Syndicat National de l'Édition Phonographique

Gratis ufänken, aktualiséieren wann Dir méi braucht

Free
  • 30-Sekonnen-Audiolimit
  • 256 px Ausgab
  • Just "Still"-Vireinstellung
  • Keng Gesiichtsverbesserung
Déi populärst
Free Account
  • 30-Sekonnen-Audiolimit
  • Beide "voll" an "still" Vireinstellungen
  • 256 / 512 px Ausgab
  • GFPGAN Gesiichtsverbesserung
Gratis anmelden
Pro
  • 5 Minutten
  • Prioritéit GPU-Warteschlange
  • API-Access (Mehrfach-Upload)
  • Webhook-Vervollstännegung Callbacks
  • D'Lizenz ass net kommerziell (net fir kommerziell Zwecker).
Aktualiséieren

Häufig gestallte Froen

Laden Si eng Gesiichtsfoto an en Audioclip erop, an d'KI generéiert e Video vun deem Gesiicht, dat den Audio mat Lipbewegungen, Kopfpositioun a Bléckwiessel schwätzt. D'Tool ass derzäit net verfügbar: et huet SadTalker (CVPR 2023) ausgefouert, deem seng 3D Gesiichtsrekonstruktiounsgewichter op dem Basel Face Model trainéiert goufen, dat fir net-kommerziell Fuerschung lizenzéiert ass.

D'Gesiicht kann en JPG oder PNG Bild (bis zu 10 MB) oder e kuerz MP4/WebM Video (mir benotze den éischten Frame) sinn. Den Audio kann MP3, WAV, M4A oder FLAC bis zu 10 MB sinn. Mir huelen intern 16 kHz Audio.

Free Accounts: bis zu 30 Sekonnen pro Clip. Paying Users: bis zu 5 Minutten pro Ufro. Longer Audio means longer render time and higher character costs.

Lip Sync Video benotzt 1.000 Zeichen pro Sekonn vum generéierte Video. E 30-Sekonnen-Clip = 30.000 Zeichen. D'Käschte ginn Iech vun Ärem Zeichen-Geldbetrag ofgerechent an automatesch zréckbezuelt wann d'Generéierung fehlschléit.

Nee. D'Tool ass ausgeschalt well d'Modelllizenz et net erlaabt. SadTalker Code ass Apache-2.0, mä säi verbënnt Gesiichtsrekonstruktiounsnetzwierk gouf op dem Basel Face Model 2009 trainéiert, deem seng Lizenz nëmmen intern, net-kommerziell Fuerschung erlaabt. Videoen déi mat him generéiert goufen virum 15. September 2026 sinn net fir kommerziell Benotzung, och net fir bezuelte Pläng. Dir sidd verantwortlech fir d'Rechter op d'Quell Gesiichtsbild an Audio ze hunn, déi Dir erofgelueden hutt.

Wann d'Tool ausgefouert gouf, huet e 5-Sekonnen-Clip ongeféier 30 Sekonnen gedauert, an huet sech ongeféier linear mat der Audiolängt skaléiert. Et ass derzäit net verfügbar, well mir no engem Talking-Head-Modell sichen, dat et no senger Lizenz erlaabt.

Voll virgesat (Standard) animéiert Kopphaltung, Bléck a Gesiichtsausdrock zesumme mat de Lippen, fir e méi natierlecht Video mat engem schwätzenden Kopf ze produzéieren. Still virgesat blockéiert de Kopf op senger Plaz an animéiert nëmmen de Mond - nëtzlech wann Dir e stabilen Avatar-Shot wëllt.

GFPGAN ass e Gesiichtsreparaturmodell, dat Gesiichtsdetailer no der Renderaarbecht verschärft. Et gëtt net ugebueden: säi StyleGAN2-Virleefer ass ënner enger net-kommerzieller NVIDIA-Lizenz an säi Gesiichtsanalysemodell ass CC BY-NC-SA.

SadTalker gëtt standardméisseg mat 256 Pixele gerendert, mat 512 Pixelen als méi lues Optioun. D'Tool ass momentan net verfügbar; e gutt beliichte Porträt mat héijer Qualitéit gëtt dat bescht Resultat mat all Modell mat engem schwätzenden Kopf.

Ja. Laad en MP4 oder WebM als Gesiichts-Input erop an mir wäerten den éischten Frame als d'Féierungsidentitéit benotzen. Fir vollstänneg Video-Re-Dubbing (pro-Frame Muddersatz), kuckt d'Dubbing Studio Video-Pipeline.

Ja. POST eng méideeleg Ufro un /api/v1/lipsync/ mat Face- a Audiofelder, da frot /api/v1/lipsync/result/?uuid= of bis de Status "completed" ass. D'Äntwert enthält eng URL zum gerenderten MP4. API-Zugang erfuerdert e bezuelte Plang.

SadTalker benotzt Gesiichtsausriichtung fir d'prominentst Gesiicht ze erfannen an ze schneiden. Fir déi bescht Resultater, laadt e Portrait mat enger Persoun am Mëttelpunkt, Aen sichtbar an minimaler Okklusion erop. Gruppfotoe kënnen onvirsiichteg Resultater produzéieren.
5.0/5 (1)

Wat kéinte mir verbesseren? Äert Feedback hëlleft eis, Problemer ze léisen.

Wëllt Dir ufänken?

Eng Kreditkaart ass net néideg.