CosyVoice 2

CosyVoice 2 نووسراو بۆ بیستراو

Alibaba Tongyi Lab's streaming TTS reaching human-parity naturalness with near-zero latency and zero-shot cloning.

تۆماربکە بۆ ٥٠٠٠ هێما

نوسراوەکەت بگۆڕە بۆ تگەکانی SSML بۆ کۆنتڕۆڵی ڕاستەقینە:

<speak><prosody rate="slow">Slow speech</prosody></speak>

تگەکان کە مۆدێلی هەڵبژێردراو تێیدەگات - بکەرەوە بۆ ئەوەی یەکێکیان بخەیتە ناو دەقەکەتەوە کە تیایدا ڕوودەدات:

ئەم مۆدێلە نوسراوێکی ئاسایی دەخوێنێتەوە، بۆیە تاگەکانی ناو ڕستە پشتگوێ دەخرێت. بۆ هەستێکی لەسەر بنەمای تاگ، بگەڕێ بۆ مۆدێلێکی دەربڕین وەک ئۆرفیۆس یان بارک.

پێناسەکردنی دەنگی خۆت (وشە = دەنگی):

-12 +12
0.5x 2.0x
بەبێ پارە لەگەڵ Piper, VITS, MeloTTS
دەنگی دروستکراوت لێرەدا دەردەکەوێت. مۆدێلێک هەڵبژێرە، نوسراوێک دابنێ، پاشان کلیک بکە لەسەر دروستکردن.
دەنگ بە سەرکەوتن دروست کرا
0:00
دابەزاندنی دەنگ دابەزاندن پەیوەستەکە دوای ٢٤ کاتژمێر کۆتایی دێت
پلەی ئازاد: بەکارهێنانی تایبەتی. مۆڵەتی بازرگانی لە ٥$/ مانگ
خۆشت دەوێت TTS.ai؟ بە هاوڕێکانت بڵێ!

دەربارەی CosyVoice 2

CosyVoice 2, from Alibaba's Tongyi Lab, was designed to make high-quality speech viable in real time. It uses a finite scalar quantization approach combined with flow matching to support streaming synthesis at extremely low latency, while reaching human-comparable naturalness that outperforms many commercial systems in subjective tests. Beyond quality, it offers zero-shot voice cloning from about 3 seconds of audio, cross-lingual synthesis, and fine-grained emotion control. Covering 8 languages with a 1,000-character cap, it's a strong fit for voice assistants, streaming TTS, and other real-time applications.

باشترین بۆ: Real-time applications, streaming TTS, voice assistants

سەردانی هەموویان بکە CosyVoice 2 دەنگی

چاوپێکەوتن

پەرەپێدەر
Alibaba (Tongyi Lab)
مۆڵەتی بەکارھێنەر
Apache 2.0
یه‌مه‌ن
standard
خێرایی
medium
دووبارە دروستکردنی دەنگی
بەڵێ
زمان
English, Chinese, Japanese, Korean, French, German, Italian, Spanish
زۆرترین پیت
1000

CosyVoice 2 دەنگی

Chinese Female

Chinese
ستاندارد Female

Chinese Male

Chinese
ستاندارد Male

English Female

English
ستاندارد Female

English Male

English
ستاندارد Male

French Female

French
ستاندارد Female

German Female

German
ستاندارد Female

Italian Female

Italian
ستاندارد Female

Japanese Female

Japanese
ستاندارد Female

Korean Female

Korean
ستاندارد Female

Spanish Female

Spanish
ستاندارد Female

CosyVoice 2 پرسیاری زۆر کراوە

Yes. CosyVoice 2 uses finite scalar quantization for streaming synthesis at very low latency, which is what makes it suitable for voice assistants and real-time applications.

Yes. It offers zero-shot voice cloning from roughly 3 seconds of reference audio, plus cross-lingual synthesis and emotion control.

Yes. CosyVoice 2 is Apache 2.0 licensed. It supports 8 languages: English, Chinese, Japanese, Korean, French, German, Italian, and Spanish.
← هەموو دەنگەکان