Adrodd Nam / Cais Nodweddion

Creuwr Fideo Cydamseru Llygaid AIName

Troi llun wyneb a clip sain yn fideo pen siarad gyda chysylltiad llais, sefyllfa pen a chlic. Dim ar gael ar hyn o bryd tra'n edrych am fodel y caniata'r drwydded iddo.

Nid yw cydweddu llais ar gael ar hyn o bryd. Treuliwyd y model SadTalker a ddefnyddiwyd ar y Model wyneb Basel, sydd wedi'i drwydded ar gyfer ymchwil di-fasnach yn unig, felly ni allwn ei gynnig ar wasanaeth talu. Nid oes unrhyw amnewid gyda thrwydded addas wedi'i osod eto.

Lanlwytho wyneb + sain

1,000 o nodau yr eiliad

Llusgwch a gollyngwch eich ffeil yma, neu Pori

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

ffeil.mp3

0 MB

Llusgwch a gollyngwch eich ffeil yma, neu Pori

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

ffeil.mp3

0 MB

Prosesu...

Yn llunio eich fideo. Mae hyn yn cymryd 30 eiliad i 2 funud fel arfer.

Eich Fideo Talking- HeadName

Lawrlwytho

Am SadTalker

SadTalker (CVPR 2023, Tencent ARC) yw model pen siaradol ffynhonnell agored sy'n bywlunio llun wyneb sengl i siarad unrhyw sain. Heblaw am wahanol fersiynau Wav2Lip, mae SadTalker hefyd yn bywlunio sefyllfa'r pen, cwympo, a mynegiant er mwyn cael canlyniad mwy naturiol.

Apache-2.0 yw cod SadTalker, ond cafodd ei bwysau ail-adeiladu wynebau 3D eu hyfforddi ar y Model wynebau Basel, y mae ei drwydded yn caniatáu ymchwil nid-gwmnïol yn unig. TTS.ai yw gwasanaeth masnachol, felly fe wnaethon ni gau'r offeryn ar 15 Medi 2026.

Cynghorion ar gyfer y Canlyniadau Gorau

  • Defnyddio portread o ansawdd uchel, wedi'i oleuo'n dda - gweladwyr llygaid, caewyd y geg
  • Mae wyneb wedi'i ganoli, sgwâr neu cydran agwedd 4:5 yn gweithio orau
  • Mae sain siarad clir (dim cerddoriaeth) yn cynhyrchu cydweddiad llais mwy llyfn
  • Galluogi GFPGAN ar gyfer lluniau arwr - dyblu'r amser arlunio ond lleihau manylion
  • Defnyddio'r rhagosodiadau Sefydlog pan ydych am gael llun avatar sefydlog

Planau Fideo Cysoni Llygaid

Dechrau am ddim, uwchraddio pan fo angen mwy

Rhydd
  • Terfyn sain 30 eiliad
  • Allbwn 256 px
  • Rhagosod "Still" yn unig
  • Dim gwella wyneb
Poblogaf
Cyfrif Rhydd
  • Terfyn sain 30 eiliad
  • Rhagosodiadau "llenwi" a "stacio"
  • 256 / 512 px allbwn
  • Cynyddu wyneb GFPGAN
Cofrestru
Proffesiynol
  • Terfyn sain 5 munud
  • Ciw blaenoriaeth GPU
  • API access (multipart upload)
  • Ail- alwadau cwblhau gwe- hoci
  • Dim ar gael ar hyn o bryd (cyfraith model di-fasnach)
Uwchraddio

Cwestiynau a Ofynnir yn Aml

Llwythwch i fyny llun wyneb a clip sain, a bydd y AI yn creu fideo o'r wyneb yn siarad y sain gyda symudiadau llais, sefyllfa'r pen a chlic. Nid yw'r offeryn ar gael ar hyn o bryd: rhedodd SadTalker (CVPR 2023), a hyfforddwyd ei bwysau adfer wyneb 3D ar y Model wyneb Basel, sydd wedi'i drwyddedu ar gyfer ymchwil di-fasnach yn unig.

Gall y mewnbwn wyneb fod yn ddelwedd JPG neu PNG (hyd at 10 MB) neu fideo gyrru MP4/WebM byr (rydym yn defnyddio'r ffrâm gyntaf). Gall y sain gyrru fod yn MP3, WAV, M4A, neu FLAC hyd at 10 MB. Rydym yn ail-ddangos sain i 16 kHz yn fewnol.

Cyfrifon am ddim: hyd at 30 eiliad y clip. Defnyddwyr sy'n talu: hyd at 5 munud y cais. Mae sain hirach yn golygu amser arlunio hirach a chostau nodau uwch.

Mae fideo cydweddu llais yn defnyddio 1,000 o nodau bob eiliad o fideo a gynhyrchir. Clipio 30 eiliad = 30,000 o nodau. Mae'r gost yn cael ei bilio o flaen llaw o'ch balans nodau ac yn cael ei ad-dalu'n awtomatig os mae'r creu yn methu.

Na. Mae'r offeryn wedi ei analluogi oherwydd nad yw'r trwydded model yn caniatáu hynny. Apache-2.0 yw cod SadTalker, ond cafodd ei rwydwaith ail-greu wynebau ei hyfforddi ar Basel Face Model 2009, y caniata ei drwydded ymchwil mewnol, nid-gwmnïol yn unig. Nid yw fideos a gynhyrchir gyda hi cyn 15 Medi 2026 ar gyfer defnydd masnachol, gan gynnwys cynlluniau talu. Rydych chi'n gyfrifol am gael y hawliau i'r ddelwedd wyneb ffynhonnell a'r sain rydych chi'n eu lawrlwytho.

Pan redodd y rhaglen, roedd clip 5 eiliad yn cymryd tua 30 eiliad, yn graddnodi'n llai na llinell gyda hyd y sain. Nid yw ar gael ar hyn o bryd tra rydym yn edrych am ddull pen siarad sy'n caniatáu hynny.

Mae'r rhagosodiadau llawn (rhagosodedig) yn bywogi sefyllfa'r pen, cwympo, ac wynebau ynghyd â'r llygaid, gan gynhyrchu fideo pen siarad mwy naturiol. Mae rhagosodiadau dal yn cloi'r pen yn ei le ac yn bywogi'r geg yn unig - defnyddiol pan ydych chi eisiau llun avatar sefydlog.

Model adfer wyneb yw GFPGAN sy'n torri manylion wynebau ar ôl eu llunio. Nid yw'n cael ei gynnig: mae ei StyleGAN2 blaenorol o dan drwydded NVIDIA nad yw'n fasnachol, ac mae ei fformiwla dosrannu wyneb yn CC BY-NC-SA.

Rhannwyd SadTalker ar 256 px yn rhagosodedig, gyda 512 px fel dewisiad mwy araf. Nid yw'r offeryn ar gael ar hyn o bryd; mae portread o ansawdd uchel, wedi ei oleuo'n dda yn rhoi'r canlyniad gorau gydag unrhyw fodel pen siarad.

Ydy. Llwythwch MP4 neu WebM fel mewnbwn wyneb a byddwn yn defnyddio'r ffrâm gyntaf fel y dynodiad gyrru. Am ail-ddiddanu fideo llawn (amnewid llygaid bob ffrâm), gweler y pibell fideo Dubbing Studio sydd ar ddod.

Ie. Postio cais aml-ran i /api/v1/lipsync/ gyda meysydd wyneb a sain, yna holi /api/v1/lipsync/result/?uuid= nes bod y statws yn "cymhwyso". Mae'r ymateb yn cynnwys URL i'r MP4 a gynhyrchwyd. Mae angen cynllun talu ar gyfer mynediad i'r API.

Defnyddia SadTalker alinio wynebau i ganfod a torri'r wynebau mwyaf amlwg. Am y canlyniadau gorau, lawrlwythwch lun gydag un person wedi'i ganoli, llygaid yn weladwy, a lleiafswm o occlusion. Gall lluniau grŵp gynhyrchu canlyniadau anrhagweladwy.
5.0/5 (1)

Beth allwn ni ei wella? Mae eich adborth yn ein helpu i ddatrys problemau.

Barod i ddechrau?

Cofrestru am ddim a chael 50 credyd. Dim angen cerdyn credyd.