AI لپ سنڪ وڊيو پيدا ڪندڙ

چهري جو فوٽو ۽ آڊيو ڪلپ کي لپ سنڪ، سر پوز ۽ ڦوڪ سان ڳالهائيندڙ سر وڊيو ۾ تبديل ڪريو. ھاڻي موجود نه آھي جيستائين اھو ماڊل ڳولي رھيا آھيون جنھن جو لائسنس اھو اجازت ڏئي.

لپ سنڪ ھن وقت موجود نه آھي. SadTalker ماڊل جيڪو استعمال ڪيو ويو آھي اھو Basel Face Model تي تربيت ڏنل آھي، جيڪو رڳو غير تجارتي تحقيق لاءِ لائسنس ٿيل آھي، تنھنڪري اسين ان کي ادا ڪيل خدمت تي پيش نه ڪري سگھون ٿا. اڃا تائين مناسب لائسنس سان ڪوبه متبادل نصب نه ڪيو ويو آھي.

آڊيو اپ لوڊ ڪريو

1,000 نشان في سيڪنڊ

پنھنجي فائل ھتي ڌڪيو ۽ ھيٺ لايو، يا برائوزر

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

فائل.mp3

0 MB

پنھنجي فائل ھتي ڌڪيو ۽ ھيٺ لايو، يا برائوزر

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

فائل.mp3

0 MB

عمل ۾...

وڊيو رندرنگ ۾. عام طور تي 30 سيڪنڊن کان 2 منٽن تائين لڳندو.

توھان جو ڳالھائيندڙ-سر وڊيو

ڊائون لوڊ

SadTalker بابت

SadTalker (CVPR 2023, Tencent ARC) هڪ مفت-سورس ڳالهائيندڙ-سر ماڊل آهي جيڪو ڪنهن به آڊيو ڳالهائڻ لاءِ هڪ چهري جي تصوير کي متحرڪ ڪري ٿو. Wav2Lip جي مختلفن جي برعڪس، SadTalker پڻ مٿي جي پوزي، ڦوڪن ۽ اظهار کي وڌيڪ قدرتي نتيجي لاءِ متحرڪ ڪري ٿو.

SadTalker جو ڪوڊ Apache-2.0 آهي، پر ان جي 3D چهري جي مرمت وزن Basel Face Model تي تربيت ڏني وئي هئي، جنهن جي لائسنس صرف غير تجارتي تحقيق جي اجازت ڏئي ٿي. TTS.ai هڪ تجارتي سروس آهي، تنهنڪري 15 سيپٽمبر 2026 تي ٽولز کي بند ڪيو ويو.

بهترين نتيجن لاءِ صلاحون

  • اعليٰ معياري، سٺي روشني وارو تصوير استعمال ڪريو - اکيون ڏسڻ ۾ اچن ٿيون، منھن بند
  • وچولي چهري وارو، مربعو يا 4:5 ابعاد وارو نسبت بهترين ڪم ڪندو آھي
  • صاف ڳالهائڻ جي آڊيو (ڪا ميڊيا) وڌيڪ مضبوط لپ سنڪ حاصل ڪري ٿي
  • هيرو شوٽس لاءِ GFPGAN کي فعال ڪريو - رندر وقت ٻه ڀيرا ڪري ٿو پر تفصيل کي تيز ڪري ٿو
  • جڏهن ته اوھان ھڪ سڌو آٽوگرافڪ شاٽ گھرو ٿا تڏھن سسٽم اڳ- ٺاھيل استعمال ڪريو

ليپ سنڪ وڊيو منصوبا

مفت شروع ڪريو، جڏھن توھان کي وڌيڪ گھرجي تڏھن اپ گريڊ ڪريو

مفت
  • 30 سيڪنڊن جي آڊيو حد
  • 256 پيڪسل آءوٽپوٽ
  • صرف "Still" اڳيون ٺاھيو
  • ڪوبه چهرو وڌائيندڙ نه
تمام مشهور
اڪائونٽ
  • 30 سيڪنڊن جي آڊيو حد
  • "پورو" ۽ "سٺو" ٻهئي اڳيون ترتيب
  • 256 / 512 پيڪسل آءوٽپوٽ
  • GFPGAN چهرو وڌائيندڙ
رجسٽر ڪريو
پرو
  • آڊيو حد
  • GPU جي ترجيح واري قطار
  • API رسائي (ٻئي حصا اپ لوڊ)
  • Webhook مڪمل ڪرڻ جي ڪالمن
  • ھن وقت دستياب نه آھي (غير تجارتي ماڊل لائسنس)
اپ گريڊ

گھڻا پڇيا ويندا سوال

چهري جو فوٽو ۽ آڊيو ڪلپ اپ لوڊ ڪريو، ۽ ائ آءِ ان چهري جو وڊيو ٺاهيندو آهي، جنهن ۾ چپن جي حرڪتن، سر جي پوز ۽ اکين جي ڦاٽڻ سان آڊيو ڳالهائيندو آهي. هي ٽولز اڄڪلهه دستياب نه آهي: اهو SadTalker (CVPR 2023) هلائيندو آهي، جنهن جي 3D چهري جي ٻيهر تعمير وزن Basel Face Model تي تربيت ڏني وئي، جيڪا صرف غير تجارتي تحقيق لاءِ لائسنس ٿيل آهي.

Face Input هڪ JPG يا PNG تصوير (10 MB تائين) يا هڪ مختصر MP4/WebM ڊرائيو ويڊيو (پھريون فريم استعمال ڪيو ويو آهي) ٿي سگهي ٿو. ڊرائيو آڊيو MP3, WAV, M4A, يا FLAC 10 MB تائين ٿي سگهي ٿو. آڊيو کي اندروني طور 16 kHz تائين ريسمپل ڪيو ويو آهي.

مفت اڪائونٽ: 30 سيڪنڊن تائين هر ڪلپ. ادا ڪندڙ صارفين: 5 منٽن تائين هر درخواست. ڊگهي آڊيو جو مطلب ڊگهو رندر وقت ۽ وڌيڪ ڪردار جي قيمت آهي.

لپ سنڪ ويڊيو 1,000 نشانن کي هر سيڪنڊ ۾ استعمال ڪري ٿي. 30 سيڪنڊن جي ڪلپ = 30,000 نشان. قيمت اڳ ۾ ئي توهان جي نشانن جي توازن مان بلڊ ڪئي ويندي ۽ جيڪڏھن پيدا ڪرڻ ۾ ناڪام ٿي وڃي ته خودڪار طرح واپس ڪئي ويندي.

نه. وسيلن کي بند ڪيو ويو آهي ڇاڪاڻ ته ماڊل لائسنس ان کي اجازت نه ڏئي. SadTalker ڪوڊ Apache-2.0 آهي، پر ان جي بونڊ ٿيل چهري جي مرمت جي نيٽ ورڪ Basel Face Model 2009 تي تربيت ڏني وئي، جنهن جي لائسنس اندروني، غير تجارتي تحقيق کي اجازت ڏئي ٿي. 15 سيپٽمبر 2026 کان اڳ ان سان ٺاهيل وڊيوز تجارتي استعمال لاءِ نه آهن، ادا ڪيل منصوبن شامل آهن. توھان ذريعو چهري جي تصوير ۽ آڊيو جي حقن جي ذميواري آھيو جيڪو توھان اپ لوڊ ڪيو.

جڏھن وسيلن ھلايو، 5 سيڪنڊن جو ڪلپ 30 سيڪنڊن تائين ھلندو ھو، آڊيو جي ڊگھائي سان تقريبن لائينري طور ماپيندو ھو. اھو ھاڻي موجود نه آھي جڏھن اسين ھڪ ڳالھائيندڙ-سر ماڊل ڳوليندا آھيون جنھن جو لائسنس اھو اجازت ڏئي.

مڪمل اڳ- ٺھرايل (درآمد) مٿي جي حالت، اکيون ڦاٽيون ۽ اکين جي تعبير کي هٿن سان گڏ متحرڪ ڪري ٿو، وڌيڪ قدرتي ڳالهائيندڙ مٿي وڊيو پيدا ڪري ٿو. اڃا تائين اڳ- ٺھرايل مٿي کي جاءِ تي بند ڪري ٿو ۽ صرف منھن کي متحرڪ ڪري ٿو - فائديمند جڏھن ته توھان ھڪ سڌو آٽوگراف شوٽ گھرو ٿا.

GFPGAN هڪ چهرو بحالي ماڊل آھي جنھن رندرنگ کان پوءِ چهرو تفصيلن کي صاف ڪيو آھي. اھو پيش نه ڪيو ويو آھي: ان جو StyleGAN2 اڳوڻو NVIDIA غير تجارتي لائسنس ھيٺ آھي ۽ ان جو چهرو پارسنگ ماڊل CC BY-NC-SA آھي.

سڊ ٽوڪيئر 256 پيڪسلز تي اڻلڀ طور رندر ڪيو ويو، 512 پيڪسلز سان آهستي آپشن طور. وسيلن جي وقت تي موجود نه آھي، هڪ سٺي روشني، اعلي معيار جي تصوير ڪنهن به ڳالهائيندڙ سر ماڊل سان بهترين نتيجو ڏئي ٿي.

ھائو. MP4 يا WebM کي چہرے کے انپٽ کے طور اپ لوڈ کرو اور ہم پہلی فریم کو چلنے کے شناخت کے طور استعمال کریں گے. مکمل ویڈیو ری-دابنگ کے لئے (پر فریم منہ کی جانشینی کے لئے)، آندھن Dubbing Studio ویڈیو پائپ لائن دیکھو.

ھائو. /api/v1/lipsync/ ڏانهن هڪ ملٽي پارٽ درخواست پوسٽ ڪريو جنهن ۾ نڪ ۽ آڊيو ميدان شامل آهن، پوءِ /api/v1/lipsync/result/?uuid= کي پوسٽ ڪريو جيستائين حالت "ڪمال" نه ٿئي. جواب ۾ رينڊڊ MP4 جو URL شامل آهي. API رسائي لاءِ ادا ڪيل منصوبو گهربل آهي.

سڊ ٽوڪر چهري جي برابري استعمال ڪري ٿو ته سڀ کان وڌيڪ نمايان چهرو ڳولي ۽ ڪٽي. بهترين نتيجن لاءِ، هڪ شخص جي وچ ۾ هڪ تصوير اپ لوڊ ڪريو، اکيون ڏسڻ ۾ اچن ٿيون، ۽ گهٽ ۾ گهٽ ڍڪڻ. گروپ جون تصويرون نامعلوم نتيجا پيدا ڪري سگھن ٿيون.
5.0/5 (1)

ڇا بهتر ڪري سگھون ٿا؟ توھان جي راءِ اسان کي مسئلا حل ڪرڻ ۾ مدد ڏيندي.

شروع ڪرڻ لاءِ تيار آھيو؟

مفت ۾ رجسٽر ٿيو ۽ 50 ڪريڊٽس حاصل ڪريو. ڪوبه ڪريڊٽ ڪارڊ گهربل ناهي.