AI লিপ সিঙ্ক ভিডিও উৎপাদক

মুখের ছবি এবং অডিও ক্লিপকে লিপ সিঙ্ক, মাথার অবস্থান এবং ঝলক সহ একটি কথা বলা মাথা ভিডিওতে রূপান্তর করুন। বর্তমানে এই বৈশিষ্ট্যটি উপলব্ধ নয়, কারণ আমরা এমন একটি মডেল খুঁজছি যার লাইসেন্স এটিকে অনুমতি দেয়।

লিপ সিঙ্ক বর্তমানে উপলব্ধ নয়। SadTalker মডেলটি Basel Face Model-এ প্রশিক্ষিত, যা শুধুমাত্র বাণিজ্যিক গবেষণার জন্য লাইসেন্সকৃত, তাই আমরা এটি একটি পেমেন্ট সার্ভিসে প্রদান করতে পারব না। এখনো কোন উপযুক্ত লাইসেন্স সহ কোন প্রতিস্থাপন ইনস্টল করা হয়নি।

মুখ + অডিও আপলোড করো

প্রতি সেকেন্ডে ১,০০০ অক্ষর

আপনার ফাইল এখানে টেনে নিয়ে যান, অথবা ব্রাউজ

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

ফাইল.mp3

0 MB

আপনার ফাইল এখানে টেনে নিয়ে যান, অথবা ব্রাউজ

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

ফাইল.mp3

0 MB

প্রসেস করা হচ্ছে...

আপনার ভিডিও রেন্ডার করা হচ্ছে। সাধারণত ৩০ সেকেন্ড থেকে ২ মিনিট সময় লাগে।

আপনার কথা বলা-মস্তিষ্ক ভিডিও

MP4 ডাউনলোড করুন

SadTalker পরিচিতি

স্যাডটোলকার (CVPR ২০২৩, টেনসেন্ট আরসি) একটি মুক্ত উৎস মুখের কথা বলার মডেল যা একটি মুখের ছবিকে অডিও বলার জন্য অ্যানিমেট করে। ওয়াভ২লিপ-এর মত না, স্যাডটোলকার মাথার অবস্থান, ঝলক এবং অভিব্যক্তিকেও আরো প্রাকৃতিক ফলাফল প্রদানের জন্য অ্যানিমেট করে।

SadTalker's code is Apache-2.0, but its 3D face reconstruction weights were trained on the Basel Face Model, whose license allows non-commercial research only. TTS.ai is a commercial service, so the tool was switched off on September 15, 2026.

সেরা ফলাফল পাওয়ার জন্য টিপস

  • উচ্চমানের, ভাল আলোকিত পোর্ট্রেট ব্যবহার করুন - চোখ দেখা যাচ্ছে, মুখ বন্ধ
  • কেন্দ্রস্থিত মুখ, বর্গক্ষেত্র অথবা ৪:৫ আকৃতির অনুপাত সবচেয়ে ভাল কাজ করে
  • পরিষ্কার বক্তৃতা অডিও (কোন সঙ্গীত নেই) ঠোঁট সমন্বয়কে আরো মজবুত করে
  • হিরো শট-এর জন্য GFPGAN সক্রিয় করুন - দ্বিগুণ রেন্ডারিং সময় কিন্তু বিস্তারিত বিবরণ
  • যখন আপনি একটি স্থিতিশীল অ্যাভাটার চিত্র নিতে চান তখন স্থির প্রাক-সেট ব্যবহার করুন

লিপ সিঙ্ক ভিডিও পরিকল্পনা

বিনামূল্যে শুরু করুন, আরো প্রয়োজন হলে আপগ্রেড করুন

মুক্ত
  • ৩০ সেকেন্ডের অডিও সীমা
  • ২৫৬ পিক্সেল আউটপুট
  • শুধুমাত্র "অবশিষ্ট" প্রাক- নির্ধারিত
  • মুখের উন্নতিকারী নেই
সবচেয়ে জনপ্রিয়
ফ্রি অ্যাকাউন্ট
  • ৩০ সেকেন্ডের অডিও সীমা
  • "পূর্ণ" এবং "স্থির" উভয় প্রসেট
  • ২৫৬ / ৫১২ পিক্সেল আউটপুট
  • GFPGAN মুখের উন্নতকারী
নিবন্ধন করুন
প্রফেশনাল
  • ৫ মিনিটের অডিও সীমা
  • অগ্রাধিকারযুক্ত GPU কলাম
  • API প্রবেশাধিকার (মাল্টিপার্শ্ব আপলোড)
  • Webhook সম্পূর্ণতা কলব্যাক
  • বর্তমানে উপলব্ধ নয় (অবাণিজ্যিক মডেল লাইসেন্স)
উন্নীতকরণ

প্রায়শ জিজ্ঞাসিত প্রশ্ন

Upload a face photo and an audio clip, and the AI generates a video of that face speaking the audio with lip movements, head pose and blinks. The tool is currently unavailable: it ran SadTalker (CVPR 2023), whose 3D face reconstruction weights were trained on the Basel Face Model, which is licensed for non-commercial research only.

মুখের ইনপুট JPG অথবা PNG ছবি (১০ মেগাবাইট পর্যন্ত) অথবা একটি সংক্ষিপ্ত MP4/WebM চালানোর ভিডিও হতে পারে (আমরা প্রথম ফ্রেম ব্যবহার করব)। চালানোর অডিও হতে পারে MP3, WAV, M4A, অথবা FLAC ১০ মেগাবাইট পর্যন্ত। আমরা অডিওকে অভ্যন্তরীণভাবে ১৬ kHz এ পুনরায় সাম্পল করব।

ফ্রি অ্যাকাউন্ট: প্রতি ক্লিপে ৩০ সেকেন্ড পর্যন্ত। প্ল্যান ব্যবহারকারী: প্রতি অনুরোধে ৫ মিনিট পর্যন্ত। দীর্ঘ অডিও মানে দীর্ঘ রেন্ডারিং সময় এবং উচ্চ অক্ষর খরচ।

লিপ সিঙ্ক ভিডিও প্রতি সেকেন্ডে ১,০০০ অক্ষর ব্যবহার করে। ৩০ সেকেন্ডের একটি ক্লিপ = ৩০,০০০ অক্ষর। এই খরচটি আপনার অক্ষর ভারসাম্য থেকে পূর্বে বিল করা হয় এবং সৃজন করতে ব্যর্থ হলে স্বয়ংক্রিয়ভাবে ফেরত দেওয়া হয়।

না। এই টুলটি বন্ধ করা হয়েছে কারণ মডেল লাইসেন্স এর অনুমতি দেয় না। স্যাডটোকার কোড হচ্ছে আপাচি-২.০, কিন্তু এর মুখ পুনরুদ্ধার নেটওয়ার্কটি বাসেল মুখ মডেল ২০০৯ এর উপর প্রশিক্ষিত, যার লাইসেন্স শুধুমাত্র অভ্যন্তরীণ, অবাণিজ্যিক গবেষণার অনুমতি দেয়। সেপ্টেম্বর ১৫, ২০২৬ এর আগে এর মাধ্যমে তৈরি ভিডিও বাণিজ্যিক ব্যবহারের জন্য নয়, পে-পাইড প্লান অন্তর্ভুক্ত। আপনি আপনার আপলোড করা মুখের ছবি এবং অডিও এর উৎস অধিকার রাখার জন্য দায়ী।

টুলটি চালানোর সময়, ৫ সেকেন্ডের একটি ক্লিপ ৩০ সেকেন্ড সময় নিয়েছিল, অডিও দৈর্ঘ্যের সাথে প্রায় লাইন আকারে স্কেল করা হয়েছিল। আমরা এমন একটি কথা বলা মাথা মডেল খুঁজছি যার লাইসেন্স এটিকে অনুমতি দেয়, সেটি বর্তমানে উপলব্ধ নয়।

পূর্ণ প্রাক-নির্ধারিত (ডিফল্ট) মাথার অবস্থান, ঝলক এবং মুখের অভিব্যক্তির সাথে সাথে ঠোঁটকে অ্যানিমেট করে, যা একটি আরও প্রাকৃতিক কথা বলা মাথার ভিডিও তৈরি করে। স্থির প্রাক-নির্ধারিত মাথাকে স্থানে লক করে এবং শুধুমাত্র মুখকে অ্যানিমেট করে - আপনি যখন একটি স্থিতিশীল অ্যাভাটার শ্যুটিং চান তখন এটি ব্যবহারযোগ্য।

জিএফপিজিএএন একটি মুখ পুনরুদ্ধার মডেল যা রেন্ডারিং করার পর মুখের বিস্তারিত বিবরণকে সুস্পষ্ট করে। এটি প্রদান করা হয় না: এর স্টাইলজিএএন২ পূর্ববর্তী এনভিডিয়ার অবাণিজ্যিক লাইসেন্সের অধীনে এবং এর মুখ পার্সিং মডেল সিসি বাই-এনসি-এসএ।

SadTalker ডিফল্টভাবে ২৫৬ পিক্সেলের মান ব্যবহার করে, ৫১২ পিক্সেলের মান ব্যবহার করলে চিত্রের গতি কমে যাবে। এই টুলটি বর্তমানে ব্যবহার করা যায় না; কোন কথা বলা মাথার মডেল ব্যবহার করলে ভালো আলোকিত, উচ্চমানের পোর্ট্রেট ছবি সবচেয়ে ভালো ফলাফল প্রদান করে।

হ্যাঁ। মুখের ইনপুট হিসেবে একটি এমপি৪ অথবা ওয়েবএম আপলোড করুন এবং আমরা প্রথম ফ্রেমটিকে চালকের পরিচয় হিসেবে ব্যবহার করব। পূর্ণ ভিডিও পুনরায় ডাবিং করার জন্য (প্রতি ফ্রেম মুখ প্রতিস্থাপন), আগামী ডাবিং স্টুডিও ভিডিও পাইপলাইন দেখুন।

হ্যাঁ। মুখ ও অডিও ক্ষেত্র সহ /api/v1/lipsync/-এ একটি বহু-অংশের অনুরোধ POST করুন, তারপর অবস্থা "সম্পন্ন" হওয়া পর্যন্ত /api/v1/lipsync/result/?uuid=-কে পোল করুন। প্রতিক্রিয়ায় MP4-র URL উপস্থিত থাকবে। API ব্যবহারের জন্য একটি পরিশোধিত পরিকল্পনা প্রয়োজন।

SadTalker মুখের আনুভূমিকতা ব্যবহার করে সবচেয়ে উল্লেখযোগ্য মুখ সনাক্ত করে এবং কাট করে। সর্বোত্তম ফলাফল পেতে, একটি পোর্ট্রেট আপলোড করুন যেখানে একজন ব্যক্তিকে কেন্দ্রে রাখা হয়েছে, চোখ দৃশ্যমান এবং অল্প অন্ধকার। গ্রুপ ফটো অপ্রত্যাশিত ফলাফল তৈরি করতে পারে।
5.0/5 (1)

আমরা কি উন্নতি করতে পারি? আপনার ফিডব্যাক আমাদের সমস্যা সমাধানে সাহায্য করে।

শুরু করার জন্য প্রস্তুত?

বিনামূল্যে নিবন্ধন করুন এবং ৫০ ক্রেডিট পাবেন। কোন ক্রেডিট কার্ডের প্রয়োজন নেই।