CosyVoice 2 អត្ថបទទៅសំឡេង
Alibaba Tongyi Lab's streaming TTS reaching human-parity naturalness with near-zero latency and zero-shot cloning.
រុំអត្ថបទរបស់អ្នកក្នុងស្លាក SSML សម្រាប់ការត្រួតពិនិត្យជាក់លាក់ ៖
<speak><prosody rate="slow">Slow speech</prosody></speak>
ស្លាកដែលម៉ូដែលដែលបានជ្រើសយល់ — ចុចដើម្បីទម្លាក់មួយទៅក្នុងអត្ថបទរបស់អ្នកនៅកន្លែងដែលវាកើតឡើង ៖
ម៉ូដែលនេះអានអត្ថបទធម្មតា ដូច្នេះស្លាកក្នុងបន្ទាត់ត្រូវបានមិនអើពើ ។ សម្រាប់អារម្មណ៍ដែលមានមូលដ្ឋានលើស្លាក ប្ដូរទៅម៉ូដែលបង្ហាញដូចជា Orpheus ឬ Bark ។
កំណត់ការបញ្ចេញសំឡេងផ្ទាល់ខ្លួន (ពាក្យ = ការបញ្ចេញសំឡេង) ៖
អំពី CosyVoice 2
CosyVoice 2, from Alibaba's Tongyi Lab, was designed to make high-quality speech viable in real time. It uses a finite scalar quantization approach combined with flow matching to support streaming synthesis at extremely low latency, while reaching human-comparable naturalness that outperforms many commercial systems in subjective tests. Beyond quality, it offers zero-shot voice cloning from about 3 seconds of audio, cross-lingual synthesis, and fine-grained emotion control. Covering 8 languages with a 1,000-character cap, it's a strong fit for voice assistants, streaming TTS, and other real-time applications.
ល្អបំផុតសម្រាប់: Real-time applications, streaming TTS, voice assistants
រកមើលទាំងអស់ CosyVoice 2 សំឡេងទិដ្ឋភាពទូទៅ
- អ្នកអភិវឌ្ឍន៍
- Alibaba (Tongyi Lab)
- អាជ្ញាបណ្ណ
- Apache 2.0
- ផ្កាយ
- standard
- ល្បឿន
- medium
- ការក្លូនសំឡេង
- បាទ/ ចាស
- ភាសា
- English, Chinese, Japanese, Korean, French, German, Italian, Spanish
- តួអក្សរអតិបរមា
- 1000