Raporteer Fout / eienskap Versoek

Aol Oombliklike Boodskapper KliÃ"ntName

Draai 'n gesigfoto en' n klank Clip in 'n praat-kop video met lipchronise, kop poseer en knip kniptjies. Tans is dit nie beskikbaar nie, terwyl ons soek vir 'n model wie se lisensie dit toelaat.

Ons het nog nie TTS-stemme in jou taal nie, help ons om joune by te voeg! Verkoop jou stem
Lip sinkis is nie tans beskikbaar nie. Die Sad Sponsermodel wat dit gebruik het, is opgelei op die Basel Face Model, wat slegs vir nie-kommersiale navorsing gelisensieer is, sodat ons dit nie op 'n betaalde diens kan aanbied nie. Geen plaasvervanger met 'n geskikte lisensie is al geïnstalleer nie.

Laaià ̄ng van K- sterre...

1 000 karakters per sekonde

Trek laat val jou lêer hier, of Deurblaai

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

lêer.mp3

0 MB

Trek laat val jou lêer hier, of Deurblaai

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

lêer.mp3

0 MB

Verwerking...

Dit neem gewoonlik 30 sekondes tot 2 minute.

Jou gesels- Head video

Aflaai hervat

Oor hartseer praatjies

Sad Talker (CVPR 2023, Tencent ARC) is 'n ope-onsorce praat-kop model wat 'n enkele beeld op 'n enkele gesig plaas om enige klank te praat. In teenstelling met Wav2Lip variante, Sad Talker ook die kop poseer, knip en uitdrukking vir 'n meer natuurlike resultaat.

Sad Speaker se kode is Apache-2.0, maar sy 3D gesig rekonstruksiesgewigte is opgelei op die Basel Face Model, wie se lisensie net nie-kommercial navorsing toelaat. z. TTS.ai is 'n kommersiële diens, en daarom is die gereedskap afgeskakel op 15 September 2026.

Wenke vir die beste resultate

  • Gebruik 'n hoë-kwaliteit, goed-liter portret eyes sigbaar, mond toegesluit
  • Gesentreerde gesig, vierkant of 4:5 aspek verhouding werk die beste
  • Skoon toespraakklank (geen musiek) lewer strenger lipruisasie
  • Aktiveer GFPGAN vir heldinspuitings iums gee tyd weer, maar skerp besonderhede toe
  • Gebruik die nogsteeds vooraf gestel wanneer jy wil hê 'n konstante avatar geskiet

L Lip Sinkronisasie video Plans

Begin sonder, opgradering wanneer u meer nodig het

Beskikbaar
  • 30-second oudiogrens
  • 256 px uitset
  • "Stil" voorafgereeld slegs
  • Geen gesigsverbeterer nie
Die gewildste
Vry rekening
  • 30-second oudiogrens
  • Beide "vol" en "stil" vooraf gedefinieer
  • 256 / 512 px uitset
  • GFPGAN-gesigverbeterer
Meld aan om vry te wees
Pro
  • 5-minute oudiogrens
  • Prioriteit GPU wagtou
  • API toegang verkry (multipart oplaai)
  • Webversterking terugbele
  • Tans nie beskikbaar nie (nie- commersiale modellisensie)
Gradeer op

Vrae wat dikwels gevra word

Laai 'n foto op en' n oudio- Clip, en die Kunsmatige hulp bring 'n video van daardie gesig op wat praat die oudio met lip bewegings, kop poseer en kniptjies. Die gereedskap is tans nie beskikbaar nie: dit het SWPR 2023, wie se 3D gesig rekonstruksiesgewigte opgelei is op die Basel gesigmodel, wat slegs gelisensieer is vir nie-kommercial navorsing.

Die gesig invoer kan 'n JPG of PNG-beeld (van tot 10 mb) wees of 'n kort MP4/WBBM bestuur video (ons gebruik die eerste raam). Die bestuur oudio kan MP3, WAV, M4A, of VLOC tot 10 mb wees. Ons hersample klank na 16 kHz intern.

Vry rekeninge: tot 30 sekondes per clip. Betaal gebruikers: tot 5 minute per versoek. Langer oudio beteken langer tyd en hoër karakterkoste.

Lip sink video gebruik 1 000 karakters per sekonde van leesvideo. 'n 30-second clip = 30 000 karakters. Die koste word aan jou karakterbalans toegeken en outomaties hersirkuleer as geslag faal.

Nee. Die gereedskap is afgeskakel omdat die modellisensie dit nie toelaat nie. Sad Sponserkode is Apache-2.0, maar sy gebondige gesigskonstruksienetwerk is opgelei op die video vir Basel Vance 2009, wie se lisensie toelaat dat interne, niekommersiale navorsing slegs. Video's wat met dit geskep word voor 15 September 2026 is nie vir kommersiële gebruik, betaalde planne ingesluit. Jy is verantwoordelik vir die regte wat op die gesigbeeld en oudio oplaai.

Wanneer die gereedskap gehardloop het, het 'n 5-second clip omtrent 30 sekondes geneem, ongeveer lineêr met klanklengte. Dit is tans nie beskikbaar nie terwyl ons soek vir 'n praat-kop model wie se lisensie dit toelaat.

Vol vooraf gestel (verstek) lewende kop poseer, knip en uitdrukking tesame met die lippe, wat 'n meer natuurlike praat-kop video vervaardig. Nog vooraf stel sluit die kop in plek en lewendes slegs die mond 0°) nuttig wanneer jy wil hê 'n bestendige avatar geskiet.

GFPGAN is 'n gesigsressparade wat geheuebesonderhede na verstellings verskerp. Dit word nie aangebied nie: sy StylGAN2 voor is onder 'n NVIDIË nie-kommersiale lisensie en sy gesigspiering model is CC deur-NC-SA.

Sad Talker wat by 256 px by verstek vertaal word, met 512 px as 'n stadiger opsie. Die nutsprogram is tans nie beskikbaar nie;' n goed-liter, hoog-quaviity portret gee die beste resultaat met enige praat-kop model.

Ja. Oplaai 'n MP4 of webm as die gesig invoer en ons sal gebruik die eerste raam as die bestuur identiteit. Vir volledige video reduping (per-frame mond plaasvervanger), sien die komende Dubing Studio-video-video-pyplyn.

Ja. DOOP 'n multipart versoek na /' npi/v1/lipsync/ met gesig en oudio velde, dan stem jy / api/v1/lipsync/result/?uuid= totdat status "volgewerk" is. Die antwoord bevat 'n Url van die vertaalde MP4.' nPI toegang benodig 'n betaalde plan.

Sad Talker gebruik gesiglyn om die prominentste gesig op te spoor en te oes. Vir die beste resultate, laai 'n portret op met een persoon wat gesentreer is, oë sigbaar en minimale akklusie. Groepfoto's kan onvoorspelbare resultate lewer.
5.0/5 (1)

U terugvoer help ons om geskille reg te stel.

Gereed om te begin?

Teken gratis op en kry 50 krediete, geen kredietkaart benodig nie