AI Lip Sync ვიდეო გენერატორიName

თჱგთნვრვ, ნვ მჲზვმ ეა ჟვ ჟოპაგთმ ჟჲ ჲგა. ჟვაგამვ ნა ჲგა. ჟვ ჟვაგაქ ლთ ნა ჲგა?

ყბა- სინქრონიზაცია ამჟამად არ არის ხელმისაწვდომი. SadTalker- ის მოდელი, რომელიც გამოიყენებოდა, ბასელის სახეების მოდელის მიხედვით იყო მომზადებული, რომელიც მხოლოდ არაკომერციული კვლევებისთვის არის ლიცენზირებული, ამიტომ ჩვენ არ შეგვიძლია მისი შეთავაზება ფასიანი სერვისის სახით. ჯერჯერობით არ არის დაყენებული შესაბამისი ლიცენზიით ჩანაცვლება.

ატვირთვა

1000 სიმბოლო წამში

გადაახვიეთ და ჩამოაგდეთ ფაილი აქ, ან ძიება

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

ფაილი.mp3

0 MB

გადაახვიეთ და ჩამოაგდეთ ფაილი აქ, ან ძიება

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

ფაილი.mp3

0 MB

ოპერაცია...

ვიდეო ატვირთვა. ეს ჩვეულებრივ 30 წამიდან 2 წუთამდე გრძელდება.

ვიდეო

ჩამოტვირთვა

ინფორმაცია SadTalker- ის შესახებ

SadTalker (CVPR 2023, Tencent ARC) არის ღია კოდის საუბრის გონების მოდელი, რომელიც აanimებს ერთ სახეს, რომ საუბრობდეს ნებისმიერ აუდიოს. Wav2Lip- ის ვარიანტებისგან განსხვავებით, SadTalker ასევე აანიმაცებს თავზე პოზას, მზერას და გამომეტყველებას უფრო ბუნებრივი შედეგისთვის.

SadTalker's code is Apache-2.0, but its 3D face reconstruction weights were trained on the Basel Face Model, whose license allows non-commercial research only. TTS.ai is a commercial service, so the tool was switched off on September 15, 2026.

საუკეთესო შედეგების რჩევები

  • გამოიყენეთ მაღალი ხარისხის, კარგად განათებული პორტრეტი - თვალები ჩანს, პირი დახურულია
  • ცენტრალური ფორმა, კვადრატი ან 4:5 ფორმატის ოპტიმალური ვარიანტი
  • სუფთა საუბრის აუდიო (მუსიკის გარეშე) უფრო ახლოს ყოფს ტუჩების სინქრონიზაციას
  • GFPGAN-ის ჩართვა გმირის გადაღებებისთვის - ორმაგდება რენდერინგის დრო, მაგრამ დეტალები უფრო ნათლად ჩანს
  • გამოიყენეთ სტაბილური ავატორის გადაღებისას სტაბილური ავატორის წინასწარ დაყენება

ვიდეო

ჱაოჲფნთ ბვჱოლარნჲ, ოპვმვჟრთ ჟვ, კჲდარჲ რთ რპწბგა ოჲგვფვ

თავისუფალი
  • 30 წამიანი აუდიოს საზღვარი
  • 256 პიქსელი გამონატანი
  • მხოლოდ "Still" წინასწარ დაყენება
  • ნვმა ოპვგჲე
ყველაზე პოპულარული
ანგარიში
  • 30 წამიანი აუდიოს საზღვარი
  • ორივე "სრულ" და "მშვიდი" წინასწარ დაყენება
  • 256 / 512 პიქსელი გამონატანი
  • GFPGAN სახეების გაუმჯობესება
რეგისტრაცია
პროფესიონალი
  • 5 წუთიანი აუდიოს საზღვარი
  • GPU- ს რიგის პრიორიტეტი
  • API წვდომა (მრავლობითი ნაწილის ჩატვირთვა)
  • ვებ- კავშირის დასრულების უკან გამოძახებები
  • ამჟამად მიუწვდომელია (არაკომერციული მოდელის ლიცენზია)
გაუმჯობესება

ხშირად დასმული კითხვები

ატვირთეთ სახეს ფოტო და აუდიო კლიპები და AI-მ შექმნის ამ სახეს ვიდეო, რომელიც აუდიოს საუბრობს ყბის მოძრაობებით, თავზე პოზა და მზერა. ინსტრუმენტი ამჟამად არ არის ხელმისაწვდომი: ის SadTalker-ს (CVPR 2023) ახორციელებს, რომლის 3D სახეების რეკონსტრუქციის წონა იყო ბასელის სახეების მოდელის სწავლება, რომელიც მხოლოდ არაკომერციული კვლევებისთვის არის ლიცენზირებული.

სახეების შეყვანა შეიძლება იყოს JPG ან PNG გამოსახულება (10 MB-მდე) ან მოკლე MP4/WebM ვიდეო (ჩვენ ვიყენებთ პირველ კამერას). აუდიო შეიძლება იყოს MP3, WAV, M4A ან FLAC 10 MB-მდე. ჩვენ 16 kHz-მდე აუდიოს შიდა გადასაღებად ვიყენებთ.

უფასო ანგარიშები: 30 წამამდე ვიდეოკლიპი. ფასიანი მომხმარებლები: 5 წუთამდე ვიდეოკლიპი. უფრო დიდი აუდიო ნიშნავს უფრო დიდ რენდერინგს და უფრო დიდ სიმბოლოების ღირებულებას.

ვიდეო 1000 სიმბოლოს იყენებს წამში. 30 წამიანი ვიდეო = 30 000 სიმბოლო. ფასები განისაზღვრება თქვენი სიმბოლოების ბალანსის მიხედვით და ავტომატურად იხდება, თუკი ვიდეო ვერ შექმნა.

არა. პროგრამა გამორთულია, რადგან ლიცენზიის მოდელმა ეს არ დაუშვა. SadTalker-ის კოდი Apache-2.0-ია, მაგრამ მისი სახეების აღდგენის ქსელი Basel Face Model 2009-ზეა მომზადებული, რომლის ლიცენზია მხოლოდ შიდა, არაკომერციულ კვლევებს ითვალისწინებს. ვიდეოები, რომლებიც 2026 წლის 15 სექტემბრამდე შექმნილია, არ არის კომერციული გამოყენებისთვის, ფასიანი გეგმების ჩათვლით. თქვენ პასუხისმგებელი ხართ იმაზე, რომ გაქვთ უფლება სახეების გამოსახულების და აუდიოს წყაროს, რომელსაც ატვირთავთ.

როდესაც ეს პროგრამა მუშაობდა, 5 წამიანი კლიპის ხანგრძლივობა დაახლოებით 30 წამი იყო, მასშტაბირება კი აუდიოს ხანგრძლივობის მიხედვით ხდებოდა. ამჟამად ეს პროგრამა არ არის ხელმისაწვდომი, რადგან ჩვენ ვეძებთ საუბრის თავს, რომლის ლიცენზიაც ამას ითვალისწინებს.

სრული წინასწარ განსაზღვრა (ნაგულისხმევი) აანიმაცებს თავის პოზას, მზერას და გამომეტყველებას, ასევე ყბებს, რაც უფრო ბუნებრივ საუბრის ვიდეოსაც ქმნის. ჯერ კიდევ წინასწარ განსაზღვრა ბლოკავს თავს ადგილზე და აანიმაცებს მხოლოდ პირს - სასარგებლოა, თუ გსურთ ავატორის სტაბილური გადაღება.

GFPGAN არის სახეების აღდგენის მოდელი, რომელიც სახეების დეტალებს ქმნის რენდერინგის შემდეგ. ის არ არის ხელმისაწვდომი: მისი StyleGAN2 წინა ვერსია NVIDIA-ს არაკომერციული ლიცენზიითაა და მისი სახეების გაანალიზების მოდელი CC BY-NC-SA-ს დაცულია.

SadTalker ნაგულისხმევად 256 პიქსელზეა გამოსახული, 512 პიქსელის ნელი ვარიანტით. ხელსაწყო ამჟამად არ არის ხელმისაწვდომი; კარგად განათებული, მაღალი ხარისხის პორტრეტი საუკეთესო შედეგს იძლევა ნებისმიერი საუბრის თავსთან.

დიახ. ატვირთეთ MP4 ან WebM როგორც სახეს შეყვანა და ჩვენ გამოვიყენებთ პირველ კამერას როგორც მართვას. სრული ვიდეო გადასინჯვისთვის (კამერაზე პირის ჩანაცვლება), იხილეთ Dubbing Studio- ს მომავალი ვიდეო ქსელი.

დიახ. POST მრავალნაწილიანი მოთხოვნა /api/v1/lipsync/-ში სახესა და აუდიოს ველით, შემდეგ /api/v1/lipsync/result/?uuid=-ში კითხვა, სანამ სტატუსი არ იქნება "დასრულებული". პასუხი შეიცავს რენდერირებული MP4-ის URL-ს. API-ს წვდომა მოითხოვს ფასიან გეგმას.

SadTalker იყენებს სახეების გასწორებას, რომ აღმოაჩინოს და დაჭრას ყველაზე გამორჩეული სახეები. საუკეთესო შედეგების მისაღებად, ჩატვირთეთ პორტრეტი ერთი ადამიანის ცენტრში, თვალების ხილვით და მინიმალური ოკლუზიით. ჯგუფური ფოტოები შეიძლება გამოიწვიოს მოულოდნელი შედეგები.
5.0/5 (1)

ჲბპარნარა ჟთ ჲბაგვჟრ ნთ ოჲმადა ეა ჟოპაგთმ ოპჲბლვმთრვ.

დჲრჲგთ ლთ ჟრვ ეა ჱაოჲფგამვ?

ოპთ£აგთ ჟვ ბვჱოლარნჲ თ ეჲბთ£ 50 კპვეთრთ. ნვ ვ ნსზნა კპვეთრნა კაპრა.