AI લિપ સિન્ક વિડીયો ઉત્પાદક

લિપ સિન્ક, માથાનો પોઝ અને બ્લિંગ સાથે બોલતા-હૃદય વીડિયોમાં ચહેરાના ફોટા અને ઓડિયો ક્લિપને ફેરવો. હાલમાં ઉપલબ્ધ નથી જ્યારે આપણે મોડેલ માટે શોધી રહ્યા છીએ જેની લાઇસન્સ તેને પરવાનગી આપે છે.

લિપ સિન્ક અત્યારે ઉપલબ્ધ નથી. SadTalker મોડેલ તે વાપરે છે તે Basel Face મોડેલ પર તાલીમ થયેલ છે, જે માત્ર બિન-વ્યાપારિક સંશોધન માટે લાઇસન્સ થયેલ છે, તેથી અમે તેને ચૂકવણી કરેલ સેવા પર પ્રદાન કરી શકતા નથી. યોગ્ય લાઇસન્સ સાથે કોઈ બદલાવ હજુ સ્થાપિત થયેલ નથી.

ચહેરો + ઓડિયો અપલોડ કરો

૧,૦૦૦ અક્ષરો પ્રતિ સેકન્ડ

તમારી ફાઇલ અહીં ખેંચો અને મૂકો, અથવા બ્રાઉઝ કરો

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

ફાઇલ.mp3

0 MB

તમારી ફાઇલ અહીં ખેંચો અને મૂકો, અથવા બ્રાઉઝ કરો

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

ફાઇલ.mp3

0 MB

પ્રક્રિયા કરી રહ્યા છીએ...

તમારા વિડીયોને રેન્ડર કરી રહ્યા છે. આ સામાન્ય રીતે ૩૦ સેકન્ડો થી ૨ મિનિટ લે છે.

તમારો બોલી રહેલ-હૃદય વિડીયો

MP4 ડાઉનલોડ કરો

SadTalker વિશે

SadTalker (CVPR 2023, Tencent ARC) એ ઓપન-સોર્સ બોલતા-મુખ મોડેલ છે કે જે કોઈપણ ઓડિયો બોલવા માટે એક ચહેરાના ચિત્રને એનિમેટ કરે છે. Wav2Lip પ્રકારો કરતાં અલગ, SadTalker પણ વધારે કુદરતી પરિણામ માટે માથાનો પોઝ, બ્લિક્સ, અને અભિવ્યક્તિને એનિમેટ કરે છે.

SadTalker નો કોડ Apache-2.0 છે, પરંતુ તેના 3D ચહેરાના પુનઃનિર્માણ વજનોને Basel Face Model પર તાલીમ આપવામાં આવી હતી, જેની લાઇસન્સ માત્ર બિન-વાણિજ્યિક સંશોધનને પરવાનગી આપે છે. TTS.ai વાણિજ્યિક સેવા છે, તેથી સાધન 15 સપ્ટેમ્બર, 2026 પર બંધ કરવામાં આવ્યું હતું.

શ્રેષ્ઠ પરિણામો માટે ટિપ્સ

  • ઉચ્ચ ગુણવત્તાવાળું, સારી રીતે પ્રકાશિત ચિત્રપટ વાપરો - આંખો દૃશ્યમાન, મોં બંધ
  • કેન્દ્રિત ચહેરો, ચોરસ અથવા ૪:૫ આસપાસનો દર શ્રેષ્ઠ રીતે કામ કરે છે
  • સાફ બોલવાની ઓડિયો (કોઈ સંગીત નથી) લીપ સિંકને કડક બનાવે છે
  • હીરો શૉટ્સ માટે GFPGAN સક્રિય કરો - બમણી રેન્ડર સમય પરંતુ વિગતો તીક્ષ્ણ બનાવે છે
  • જ્યારે તમે સ્થિર અવતાર શૂટ ઇચ્છો ત્યારે સ્ટીલ પૂર્વસુયોજન વાપરો

લિપ સિન્ક વિડીયો યોજનાઓ

મુક્ત શરૂઆત, જ્યારે તમારે વધારેની જરૂર હોય ત્યારે સુધારો

મુક્ત
  • ૩૦-સેકન્ડ ઓડિયો મર્યાદા
  • 256 px આઉટપુટ
  • ફક્ત "હજુ" પૂર્વસુયોજિત
  • ચહેરો વધારનાર નથી
સૌથી લોકપ્રિય
મુક્ત ખાતું
  • ૩૦-સેકન્ડ ઓડિયો મર્યાદાઓ
  • બંને "પૂરું" અને "શાંત" પૂર્વસુયોજનો
  • ૨૫૬ / ૫૧૨ px આઉટપુટ
  • GFPGAN ચહેરો વધારનાર
મફત નોંધણી કરો
પ્રો
  • ૫-મિનિટ ઓડિયો મર્યાદાઓ
  • પ્રાથમિકતા GPU કતાર
  • API પ્રવેશ (બહુભાગી અપલોડ)
  • Webhook સમાપ્તિ કોલબેક
  • હાલમાં ઉપલબ્ધ નથી (અવ્યાવસાયિક મોડેલ લાઇસન્સ)
સુધારો

વારંવાર પૂછાતા પ્રશ્નો

ચહેરાનો ફોટો અને ઓડિયો ક્લિપ અપલોડ કરો, અને AI એ ચહેરાનો વિડીયો લિપ ગતિ, માથાનો પોઝ અને બ્લિક્સ સાથે ઓડિયો બોલી શકે છે. સાધન હાલમાં ઉપલબ્ધ નથી: તે SadTalker (CVPR 2023) ચલાવી રહ્યું છે, જેના 3D ચહેરાના પુનઃનિર્માણ વજનોને Basel Face Model પર તાલીમ આપવામાં આવી હતી, જે માત્ર બિન-વ્યાવસાયિક સંશોધન માટે લાઇસન્સ થયેલ છે.

ચહેરો ઇનપુટ JPG અથવા PNG ચિત્ર (10 MB સુધી) અથવા ટૂંકો MP4/WebM ડ્રાઇવિંગ વિડીયો હોઈ શકે (અમે પહેલું ચોકઠું વાપરીએ છીએ). ડ્રાઇવિંગ ઓડિયો MP3, WAV, M4A, અથવા FLAC 10 MB સુધી હોઈ શકે. અમે આંતરિક રીતે 16 kHz માં ઓડિયોનું પુન:સેમ્પલ કરીએ છીએ.

મુક્ત ખાતાઓ: ક્લિપ પ્રતિ ૩૦ સેકન્ડો સુધી. ચૂકવણી કરનાર વપરાશકર્તાઓ: મંજૂરી પ્રતિ ૫ મિનિટ સુધી. લાંબો ઓડિયો એટલે લાંબો રેન્ડર સમય અને ઊંચો અક્ષર ખર્ચ.

લિપ સુમેળ વિડીયો 1,000 અક્ષરો પ્રતિ સેકન્ડ ઉત્પન્ન થયેલ વિડીયોનો ઉપયોગ કરે છે. 30-સેકન્ડ ક્લિપ = 30,000 અક્ષરો. ખર્ચ તમારા અક્ષર સંતુલનમાંથી આગળથી બિલ કરવામાં આવે છે અને આપમેળે પાછો આપવામાં આવે છે જો ઉત્પાદન નિષ્ફળ જાય.

ના. સાધન બંધ છે કારણ કે મોડેલ લાઇસન્સ તેને પરવાનગી આપતું નથી. SadTalker કોડ એ Apache-2.0 છે, પરંતુ તેના બન્ધલેડ ચહેરાના પુનઃનિર્માણ નેટવર્કને Basel Face Model 2009 પર તાલીમ આપવામાં આવી હતી, જેની લાઇસન્સ આંતરિક, બિન-વ્યાપારિક સંશોધનને પરવાનગી આપે છે. સપ્ટેમ્બર 15, 2026 પહેલા તેના સાથે ઉત્પન્ન થયેલ વિડિઓઝ વેપારિક ઉપયોગ માટે નથી, ચૂકવણી યોજનાઓ સમાવેલ છે. તમે સ્ત્રોત ચહેરાના ચિત્ર અને ઓડિયો માટે અધિકારો માટે જવાબદાર છો જે તમે અપલોડ કરો છો.

જ્યારે સાધન ચલાવ્યું ત્યારે, ૫-સેકન્ડ ક્લિપ ૩૦ સેકન્ડની આસપાસ લીધી, ઓડિયો લંબાઈ સાથે લગભગ રેખીય માપદંડ. તે હાલમાં ઉપલબ્ધ નથી જ્યારે અમે બોલતા-હેડ મોડેલ માટે શોધી રહ્યા છીએ જેની લાઇસન્સ તેને પરવાનગી આપે છે.

પૂર્ણ પૂર્વસુયોજિત (મૂળભૂત) માથાનો પોઝ, ચીસો અને હોઠ સાથે અભિવ્યક્તિને એનિમેટ કરે છે, વધુ કુદરતી બોલતા-માથાનો વિડિયો ઉત્પન્ન કરે છે. હજુ પૂર્વસુયોજિત માથાને જગ્યાએ તાળુ મારે છે અને માત્ર મોંને એનિમેટ કરે છે - ઉપયોગી જ્યારે તમે સ્થિર અવતાર શૂટ ઇચ્છો.

GFPGAN એ ચહેરાના પુનઃસ્થાપન મોડેલ છે કે જે રેન્ડરિંગ પછી ચહેરાની વિગતો તીક્ષ્ણ કરે છે. તે ઓફર થયેલ નથી: તેનું StyleGAN2 પહેલાનું NVIDIA બિન-વાણિજ્યિક લાઇસન્સ હેઠળ છે અને તેનું ચહેરાના પદચ્છેદન મોડેલ CC BY-NC-SA છે.

SadTalker મૂળભૂત રીતે 256 px પર રેન્ડર થયેલ છે, ધીમી વિકલ્પ તરીકે 512 px સાથે. સાધન હાલમાં ઉપલબ્ધ નથી; સારી રીતે પ્રકાશિત, ઉચ્ચ ગુણવત્તાવાળું પોર્ટ્રેટ કોઈપણ બોલતા-હૃદય મોડેલ સાથે શ્રેષ્ઠ પરિણામ આપે છે.

હા. MP4 અથવા WebM ને ચહેરાના ઇનપુટ તરીકે અપલોડ કરો અને અમે ડ્રાઇવિંગ ઓળખ તરીકે પ્રથમ ચોકઠું વાપરીશું. સંપૂર્ણ વિડિયો પુનઃ-ડબિંગ માટે (પર-ચોકઠું મોં બદલવા માટે), આવનારી ડબિંગ સ્ટુડિયો વિડિયો પાઇપલાઇન જુઓ.

હા. /api/v1/lipsync/ ને ચહેરો અને ઓડિયો ક્ષેત્રો સાથે બહુભાગની વિનંતી POST કરો, પછી સ્થિતિ "પૂર્ણ" થાય ત્યાં સુધી /api/v1/lipsync/result/?uuid= ને પૂછો. જવાબમાં રેન્ડર થયેલ MP4 માટે URL સમાવેલ છે. API પ્રવેશ માટે ચૂકવણી થયેલ યોજના જરૂરી છે.

SadTalker સૌથી પ્રખ્યાત ચહેરાને શોધવા અને કાપવા માટે ચહેરાની ગોઠવણી વાપરે છે. શ્રેષ્ઠ પરિણામો માટે, એક વ્યક્તિ કેન્દ્રિત, આંખો દૃશ્યમાન, અને ન્યૂનતમ બંધબેસતી સાથે ચિત્ર અપલોડ કરો. જૂથ ફોટા અનિશ્ચિત પરિણામો ઉત્પન્ન કરી શકે છે.
5.0/5 (1)

અમે શું સુધારી શકીએ? તમારો પ્રતિભાવ અમને સમસ્યાઓ ઉકેલવામાં મદદ કરે છે.

શરૂ કરવા માટે તૈયાર છો?

મફત નોંધણી કરો અને ૫૦ ક્રેડિટ્સ મેળવો. કોઈ ક્રેડિટ કાર્ડની જરૂર નથી.