រាយការណ៍​កំហុស / សំណើ​លក្ខណៈ​ពិសេស

កម្មវិធី​បង្កើត​វីដេអូ​ធ្វើ​សមកាលកម្ម​មាត់ AI

ប្ដូរ​រូបថត​មុខ និង​វីដេអូ​អូឌីយ៉ូ​ទៅ​ជា​វីដេអូ​និយាយ​ក្បាល​ជាមួយ​នឹង​ការ​សមកាលកម្ម​ច្រមុះ កាយវិការ​ក្បាល និង​បន្លឺ​សំឡេង​បន្លឺ​ឡើង ។ បច្ចុប្បន្ន​មិន​អាច​ប្រើ​បាន​ទេ ខណៈ​ពេល​ដែល​យើង​មើល​ម៉ូដែល​ដែល​អាជ្ញាប័ណ្ណ​អនុញ្ញាត​ឲ្យ​វា ។

យើង​មិន​មាន​សំឡេង TTS ក្នុង​ភាសា​របស់​អ្នក​នៅ​ឡើយ​ទេ ។ ជួយ​យើង​បន្ថែម​របស់​អ្នក ! លក់​សំឡេង​របស់​អ្នក
Lip sync មិន​អាច​ប្រើ​បាន​នៅ​ពេល​នេះ​ទេ ។ ម៉ូដែល SadTalker ដែល​វា​ប្រើ​បាន​ហ្វឹកហាត់​លើ​ម៉ូដែល​មុខ Basel ដែល​មាន​អាជ្ញាប័ណ្ណ​សម្រាប់​ការ​ស្រាវជ្រាវ​មិន​ពាណិជ្ជកម្ម​តែ​ប៉ុណ្ណោះ ដូច្នេះ​យើង​មិន​អាច​ផ្តល់ជូន​វា​លើ​សេវា​ដែល​បាន​បង់ ។ គ្មាន​ការ​ជំនួស​ជាមួយ​នឹង​អាជ្ញាប័ណ្ណ​សមរម្យ​ដែល​បាន​ដំឡើង​នៅ​ឡើយ​ទេ ។

ផ្ទុក​មុខ + អូឌីយ៉ូ​ឡើង

១, ០០០ តួអក្សរ​ក្នុង​មួយ​វិនាទី

អូស និង​ទម្លាក់​ឯកសារ​របស់​អ្នក​នៅ​ទីនេះ ឬ រកមើល

JPG, PNG, or short MP4/WebM. Max 10MB. One clear, well-lit face works best.

ឯកសារ.mp3

0 MB

អូស និង​ទម្លាក់​ឯកសារ​របស់​អ្នក​នៅ​ទីនេះ ឬ រកមើល

MP3, WAV, M4A, or FLAC. Max 10MB. Free: up to 30 sec. Pro: up to 5 min.

ឯកសារ.mp3

0 MB

កំពុង​ដំណើរការ...

បង្ហាញ​វីដេអូ​របស់​អ្នក ។ ជា​ទូទៅ​វា​ចំណាយ​ពេល ៣០ វិនាទី​ទៅ ២ នាទី ។

វីដេអូ​ក្បាល​និយាយ​របស់​អ្នក

ទាញយក

អំពី SadTalker

SadTalker (CVPR 2023, Tencent ARC) គឺជាម៉ូដែលនិយាយ-ក្បាលប្រភពបើកចំហដែលធ្វើអោយមានចលនារូបភាពមុខតែមួយដើម្បីនិយាយអូឌីយ៉ូណាមួយ។ មិនដូចកំណែ Wav2Lip ទេ SadTalker ក៏ធ្វើអោយមានចលនាក្បាលដាក់ ភ្លឺ និងសម្ដីសម្រាប់លទ្ធផលធម្មជាតិជាង។

កូដ SadTalker គឺ Apache-2.0, ប៉ុន្តែទម្ងន់នៃការកសាងឡើងវិញមុខ 3D របស់វាត្រូវបានបណ្តុះបណ្តាលនៅលើម៉ូដែលមុខ Basel, អាជ្ញាប័ណ្ណដែលអនុញ្ញាតឱ្យតែការស្រាវជ្រាវមិនពាណិជ្ជកម្មប៉ុណ្ណោះ។ TTS.ai គឺជាសេវាកម្មពាណិជ្ជកម្មដូច្នេះឧបករណ៍ត្រូវបានបិទនៅលើខែកញ្ញា 15, 2026 ។

ព័ត៌មាន​ជំនួយ​សម្រាប់​លទ្ធផល​ល្អ​បំផុត

  • ប្រើ​រូបថត​ដែល​មាន​គុណភាព​ខ្ពស់ និង​មាន​ពន្លឺ​ល្អ - ភ្នែក​មើល​ឃើញ មាត់​បិទ
  • មុខ​កណ្ដាល, ការេ ឬ 4:5សមាមាត្រ​ផ្ទៃ​ធ្វើការ​ល្អ
  • អូឌីយ៉ូ​និយាយ​ស្អាត (គ្មាន​តន្ត្រី) នាំ​ឲ្យ​មាន​ការ​ធ្វើ​សមកាលកម្ម​មាត់​ដែល​រឹង​ជាង
  • អនុញ្ញាត GFPGAN សម្រាប់​ការ​ថត​វីរបុរស - បង្កើន​ពេលវេលា​បង្ហាញ​ទ្វេដង ប៉ុន្តែ​ធ្វើ​ឲ្យ​លម្អិត​ច្បាស់
  • ប្រើ​ការ​កំណត់​ជាមុន​ស្ងៀម ពេល​អ្នក​ចង់​បាន​រូប​តំណាង​ថត​ស្ងាត់

ផែនការ​វីដេអូ​ធ្វើ​សមកាលកម្ម​ច្រមុះName

ចាប់ផ្តើម​ដោយ​ឥតគិតថ្លៃ ធ្វើ​ឲ្យ​ប្រសើរ​ឡើង​នៅពេល​អ្នក​ត្រូវការ​បន្ថែម

ឥត​គិត​ថ្លៃ
  • ដែន​កំណត់​អូឌីយ៉ូ ៣០ វិនាទី
  • លទ្ធផល ២៥៦ ភីកសែល
  • កំណត់​ជាមុន​តែ "នៅ​ដដែល" ប៉ុណ្ណោះ
  • គ្មាន​កម្មវិធី​បង្កើន​មុខ​ទេ
ពេញនិយម​បំផុត
គណនី​ឥតគិតថ្លៃ
  • ដែន​កំណត់​អូឌីយ៉ូ ៣០ វិនាទី
  • ទាំង​ការ​កំណត់​ជាមុន "ពេញលេញ" និង "នៅ​ស្ងៀម"
  • លទ្ធផល ២៥៦ / ៥១២ ភីកសែល
  • កម្មវិធី​បង្កើន​មុខ​របស់ GFPGAN
ចុះឈ្មោះដោយឥតគិតថ្លៃ
ជំនាញ
  • ដែន​កំណត់​អូឌីយ៉ូ ៥ នាទី
  • ជួរ GPU ដែលមាន​អាទិភាព
  • ការ​ចូលដំណើរការ API (ផ្ទុក​ឡើង​ច្រើន​ផ្នែក)
  • ការ​ហៅ​ត្រឡប់​ការ​បំពេញ Webhook
  • បច្ចុប្បន្ន​មិន​អាច​ប្រើ​បាន (អាជ្ញាប័ណ្ណ​ម៉ូដែល​មិន​ជា​ពាណិជ្ជកម្ម)
ធ្វើ​ឲ្យ​ប្រសើរ

សំណួរ​ដែល​សួរ​ញឹកញាប់

ឧបករណ៍នេះគឺមិនអាចរកបានបច្ចុប្បន្ន: វាបានរត់ SadTalker (CVPR 2023), ទំងន់នៃការកសាងឡើងវិញមុខ 3D របស់ខ្លួនត្រូវបានបណ្តុះបណ្តាលនៅលើ Basel ម៉ូដែលមុខ, ដែលត្រូវបានអាជ្ញាប័ណ្ណសម្រាប់តែការស្រាវជ្រាវមិនមែនពាណិជ្ជកម្ម.

មុខបញ្ចូលអាចជារូបភាព JPG ឬ PNG (រហូតដល់ទៅ 10 មេកាបៃ) ឬវីដេអូ MP4 / WebM ខ្លី (យើងប្រើស៊ុមដំបូង) ។ អូឌីយ៉ូបើកបរអាចជា MP3, WAV, M4A, ឬ FLAC រហូតដល់ទៅ 10 មេកាបៃ។ យើងបានយកឧទាហរណ៍អូឌីយ៉ូទៅ 16 kHz ខាងក្នុង។

គណនីឥតគិតថ្លៃ: រហូតដល់ទៅ 30 វិនាទីក្នុងមួយចន្លោះ. បង់ប្រាក់អ្នកប្រើ: រហូតដល់ទៅ5នាទីក្នុងមួយសំណើ. អូឌីយ៉ូវែងមានន័យថាពេលវេលាបង្ហាញវែងនិងតម្លៃតួអក្សរខ្ពស់។

វីដេអូ Lip Sync ប្រើ 1,000 តួអក្សរ ក្នុងមួយវិនាទីនៃវីដេអូដែលបានបង្កើត។ វីដេអូ 30 វិនាទី = 30,000 តួអក្សរ។ តម្លៃត្រូវបានបង់ប្រាក់ពីមុនពីតួអក្សររបស់អ្នកនិងត្រូវបានសងវិញដោយស្វ័យប្រវត្តិប្រសិនបើការបង្កើតបរាជ័យ។

ទេ. ឧបករណ៍នេះត្រូវបានបិទដោយសារតែអាជ្ញាប័ណ្ណម៉ូដែលមិនអនុញ្ញាតឱ្យវា. កូដ SadTalker គឺ Apache-2.0, ប៉ុន្តែបណ្តាញការកសាងមុខបែងចែករបស់ខ្លួនត្រូវបានបណ្តុះបណ្តាលនៅលើ Basel ម៉ូដែលមុខ 2009, អាជ្ញាប័ណ្ណដែលអនុញ្ញាតឱ្យខាងក្នុង, ការស្រាវជ្រាវមិនពាណិជ្ជកម្មតែប៉ុណ្ណោះ. វីដេអូដែលបានបង្កើតឡើងជាមួយវាមុនខែកញ្ញា 15, 2026 គឺមិនសម្រាប់ការប្រើប្រាស់ពាណិជ្ជកម្ម, ផែនការដែលបានបង់រួមបញ្ចូល. អ្នកទទួលខុសត្រូវសម្រាប់ការមានសិទ្ធិទៅប្រភពរូបភាពមុខនិងអូឌីយ៉ូដែលអ្នកផ្ទុកឡើង.

ពេល​ឧបករណ៍​រត់ វីដេអូ​៥​វិនាទី​ត្រូវ​ចំណាយ​ពេល​ប្រហែល ៣០ វិនាទី ធ្វើ​មាត្រដ្ឋាន​តាម​រយៈ​ប្រវែង​អូឌីយ៉ូ​តាម​រយៈ​បន្ទាត់​ ។ វា​មិន​អាច​ប្រើ​បាន​នៅ​ពេល​បច្ចុប្បន្ន​ទេ ខណៈ​ពេល​ដែល​យើង​មើល​ម៉ូដែល​ក្បាល​និយាយ​ដែល​អាជ្ញាប័ណ្ណ​អនុញ្ញាត​ឲ្យ​វា ។

ការ​កំណត់​ជាមុន​ពេញលេញ (លំនាំដើម) ធ្វើ​ឲ្យ​មាន​ចលនា​ក្បាល ព្រិល និង​សម្ដី​រួម​ជាមួយ​នឹង​បបូរមាត់ បង្កើត​វីដេអូ​និយាយ​ក្បាល​ធម្មជាតិ​ជាង​មុន ។ ការ​កំណត់​ជាមុន​នៅ​តែ​ចាក់សោ​ក្បាល​នៅ​កន្លែង និង​ធ្វើ​ឲ្យ​មាន​ចលនា​តែ​មាត់​ប៉ុណ្ណោះ - មាន​ប្រយោជន៍​ពេល​អ្នក​ចង់​បាន​រូបភាព​តំណាង​ដែល​មាន​ស្ថេរភាព ។

GFPGAN គឺជា​គំរូ​ស្ដារ​មុខ​ដែល​បាន​ធ្វើ​ឲ្យ​លម្អិត​មុខ​កាន់តែ​ច្បាស់​បន្ទាប់​ពី​បង្ហាញ ។ វា​មិន​ត្រូវ​បាន​ផ្តល់ជូន​ទេ ៖ StyleGAN2 មុន​របស់​វា​ស្ថិត​នៅ​ក្រោម​អាជ្ញាប័ណ្ណ​មិន​ពាណិជ្ជកម្ម​របស់ NVIDIA ហើយ​គំរូ​ញែក​មុខ​របស់​វា​គឺ CC BY-NC-SA ។

SadTalker បង្ហាញ​នៅ​លើ 256 ភីកសែល​តាម​លំនាំដើម​ជាមួយ 512 ភីកសែល​ជា​ជម្រើស​យឺត ។ ឧបករណ៍​បច្ចុប្បន្ន​មិន​អាច​ប្រើ​បាន​ទេ រូបថត​មាន​គុណភាព​ខ្ពស់​ដែល​មាន​ពន្លឺ​ល្អ​ផ្តល់​លទ្ធផល​ល្អ​បំផុត​ជាមួយ​ម៉ូដែល​ក្បាល​និយាយ​ណាមួយ ។

បាទ. ផ្ទុកឡើង MP4 ឬ WebM ជាមុខបញ្ចូលហើយយើងនឹងប្រើស៊ុមដំបូងជាអត្តសញ្ញាណបើកបរ។ សម្រាប់វីដេអូពេញលេញឡើងវិញ (ជំនួសមាត់ក្នុងមួយស៊ុម) សូមមើលបំពង់វីដេអូ Dubbing Studio នាពេលអនាគត។

បាទ/ ចាស ។ POST សំណើ​ផ្នែក​ច្រើន​ទៅ /api/v1/lipsync/ ជាមួយ​វាល​មុខ និង​អូឌីយ៉ូ បន្ទាប់​មក​សួរ /api/v1/lipsync/result/?uuid= រហូត​ដល់​ស្ថានភាព​គឺ "បាន​បញ្ចប់" ។ ការ​ឆ្លើយតប​មាន URL ទៅ​កាន់ MP4 ដែល​បាន​បង្ហាញ ។ ការ​ចូល​ដំណើរការ API ត្រូវការ​ផែនការ​ដែល​បាន​បង់ ។

SadTalker ប្រើ​ការ​តម្រឹម​មុខ​ដើម្បី​រក​ឃើញ និង​កាត់​មុខ​ដែល​មាន​ភាព​គួរ​ឱ្យ​កត់​សម្គាល់​បំផុត ។ សម្រាប់​លទ្ធផល​ល្អ​បំផុត ផ្ទុក​រូបថត​មួយ​ដែល​មាន​មនុស្ស​ម្នាក់​នៅ​កណ្ដាល ភ្នែក​មើល​ឃើញ និង​ការ​បិទ​ភ្នែក​អប្បបរមា ។ រូបថត​ក្រុម​អាច​ផលិត​លទ្ធផល​ដែល​មិន​អាច​ព្យាករណ៍​បាន ។
5.0/5 (1)

តើ​យើង​អាច​ធ្វើ​អ្វី​បាន​ប្រសើរ​ឡើង ? មតិ​យោបល់​របស់​អ្នក​ជួយ​យើង​ជួសជុល​បញ្ហា ។

រួចរាល់​ដើម្បី​ចាប់ផ្ដើម​ឬ ?

ចុះឈ្មោះដោយឥតគិតថ្លៃនិងទទួលបាន 50 ពិន្ទុ. គ្មានកាតឥណទានចាំបាច់.