مولد فيديو ذا شفتين

تحويل صورة وجه ومقطع صوتيّ إلى فيديو رأس متكلم مع تزامن الشفاه، وضع الرأس، و الرمش غير متاح حالياً بينما نبحث عن نموذج يسمح ترخيصه بذلك

لم يكن تزامن الشفاه متاحاً في الوقت الحالي. وقد تم تدريب نموذج SadTalker الذي استخدمه على نموذج الوجه في بازل، الذي تم ترخيصه للبحوث غير التجارية فقط، لذا لا يمكننا تقديمه على خدمة مدفوعة. لم يتم تثبيت أي بديل مع ترخيص مناسب بعد.

تحميل الوجه + الصوت

000 1 حرف في الثانية

اسحب و أسقط ملفك هنا، أو تصفح

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

ملف.mp3

0 MB

اسحب و أسقط ملفك هنا، أو تصفح

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

ملف.mp3

0 MB

تجهيز...

إعادة عرض الفيديو الخاص بك، وهذا عادة ما يستغرق 30 ثانية إلى دقيقتين.

فيديو رأسك المتكلم

تنزيل MP4

عن ساد تاكر

SadTalker (CVPR 2023، Tencent ARC) هو نموذج مفتوح المصدر لرأس متحدث يقوم بتنشيط صورة وجه واحدة للتحدث بأي صوت. على عكس متغيرات Wav2Lip، يقوم SadTalker أيضا بتنشيط وضع الرأس، والرمشة، والتعبير لتحقيق نتيجة أكثر طبيعية.

شفرة SadTalker هي Apache-2.0، ولكن وزنها 3D إعادة بناء الوجه تم تدريبه على نموذج Basel Face، الذي يسمح ترخيصه بالبحوث غير التجارية فقط. TTS.ai هي خدمة تجارية، لذلك تم إغلاق الأداة في 15 سبتمبر 2026.

نصائح لتحقيق أفضل النتائج

  • استخدام صورة عالية الجودة ومضاءة إضاءة جيدة - العينان مرئيتان والفم مغلق
  • الوجه المركزي، أو المربع أو نسبة العرض إلى الارتفاع 4:5
  • صوت الكلام النظيف (لا موسيقى) ينتج تزامناً أكثر إحكاماً للشفتين
  • تفعيل GFPGAN لصور الأبطال - مضاعفة وقت العرض ولكن يشدد التفاصيل
  • استخدم الوضع الثابت عندما تريد صورة ثابتة للصورة الافتراضية

خطط الفيديو

ابدأ مجانا، وارتفع عندما تحتاج إلى المزيد

مجاني
  • مدة 30 ثانية كحد أقصى للصوت
  • 256 نقطة في البوصة
  • "لا يزال" مسبقاً فقط
  • لا يوجد محسن للوجه
الأكثر شعبية
حساب مجاني
  • مدة 30 ثانية كحد أقصى للصوت
  • كل من "كامل" و "الثابت" مسبقة الصنع
  • 256/512 نقطة في البوصة
  • جهاز تعزيز الوجه GFPGAN
انضم مجانا
المؤيدون
  • مدة قصوى للتسجيلات الصوتية 5 دقائق
  • صف أولوية وحدة المعالجة الرسومية
  • الوصول إلى واجهة البرمجة التطبيقية (تحميل أجزاء متعددة)
  • استدعاءات استكمال Webhook
  • غير متاح حاليا (تراخيص نموذجية غير تجارية)
التحسين

الأسئلة المتكررة

Upload a face photo and an audio clip, and the AI generates a video of that face speaking the audio with lip movements, head pose and blinks. The tool is currently unavailable: it ran SadTalker (CVPR 2023), whose 3D face reconstruction weights were trained on the Basel Face Model, which is licensed for non-commercial research only.

يمكن أن يكون مدخل الوجه صورة JPG أو PNG (حتى 10 ميغابايت) أو فيديو قصير MP4/WebM للقيادة (نستخدم الإطار الأول). ويمكن أن يكون الصوت القيادة MP3، WAV، M4A، أو FLAC حتى 10 ميغابايت. نحن نعيد اختبار الصوت إلى 16 كيلوهرتز داخليا.

حسابات مجانية: حتى 30 ثانية لكل مقطع.المستخدمون المدفوعون: حتى 5 دقائق لكل طلب.الصوت الأطول يعني وقت عرض أطول وتكلفة أعلى للكائنات.

يستخدم فيديو التزامن الشفوي 1000 كلمة في الثانية من الفيديو المولد. مقطع فيديو مدته 30 ثانية = 30 كلمة. يتم تحميل التكلفة مقدما من رصيد كلمتك ويتم ردها تلقائيا إذا فشل توليد.

لا. الأداة معطلة لأن ترخيص النموذج لا يسمح بذلك. شفرة SadTalker هي Apache-2.0، ولكن شبكة إعادة بناء الوجه المجمعة لديها تم تدريبها على نموذج 2009 لنموذج الوجه في بازل، الذي يسمح ترخيصه بالبحوث الداخلية غير التجارية فقط. الفيديوهات التي تم إنتاجها به قبل 15 سبتمبر 2026 ليست للاستخدام التجاري، بما في ذلك الخطط المدفوعة. أنت مسؤول عن امتلاك حقوق صورة الوجه المصدر والصوت الذي تحمله.

When the tool ran, a 5-second clip took about 30 seconds, scaling roughly linearly with audio length. It is currently unavailable while we look for a talking-head model whose license allows it.

يقوم الوضع المسبق الكامل (الافتراضي) بتحريك وضع الرأس، والرمشة، والتعبير إلى جانب الشفاه، مما ينتج فيديو أكثر طبيعية للرأس المتكلم. يقوم الوضع المسبق المتبقي بتثبيت الرأس في مكانه ويحريك الفم فقط - مفيد عندما تريد صورة صورة ثابتة.

GFPGAN هو نموذج لترميم الوجه الذي يجعل تفاصيل الوجه واضحة بعد العرض. فهو غير متوفر: StyleGAN2 السابق له هو تحت ترخيص NVIDIA غير التجاري ونموذج تحليل الوجه هو CC BY-NC-SA.

SadTalker تعرض في 256 px افتراضيا، مع 512 px كخيار أبطأ. الأداة غير متاحة حاليا؛ صورة فوتوغرافية عالية الجودة ومضاءة جيدا تعطي أفضل نتيجة مع أي نموذج رأس متحدث.

نعم، قم بتحميل ملف MP4 أو WebM كمدخل للوجه وسنستخدم الإطار الأول كهوية القيادة. للحصول على إعادة دبلجة الفيديو الكاملة (استبدال الفم في كل إطار)، انظر قناة الفيديو المقبلة في استوديو الدبلجة.

نعم. ضع طلبًا متعدد الأجزاء إلى /api/v1/lipsync/ مع حقول الوجه والصوت، ثم استطلع /api/v1/lipsync/result/?uuid= حتى يتم الانتهاء من الوضع. وتحتوي الاستجابة على عنوان URL إلى MP4 المعروض. يتطلب الوصول إلى API خطة مدفوعة.

يستخدم SadTalker تطابق الوجه للكشف عن الوجه الأكثر بروزاً وقطعه. ولأفضل النتائج، قم بتحميل صورة شخصية بشخص واحد في المركز، والعيون مرئية، والحد الأدنى من الإغلاق. قد تنتج صور المجموعة نتائج لا يمكن التنبؤ بها.
5.0/5 (1)

ما الذي يمكننا تحسينه؟ تساعدنا تعليقاتكم على حل المشاكل.

جاهز للبدء؟

انضم مجاناً واحصل على 50 نقطة لا تحتاج لبطاقة ائتمان