CosyVoice3

CosyVoice3 ټي ټي اېس

Alibaba FunAudioLLM's latest multilingual model with ~150ms bi-streaming, instruction control, and zero-shot cloning.

ننوتل د 5,000 لوښه حد

د دقیق کنټرول لپاره په SSML نښانونو خپل متن واچوئ:

<speak><prosody rate="slow">Slow speech</prosody></speak>

توري د ټاکل شوي ماډل پوهیږي - کلیک وکړئ چې ستاسو په متن کې یو راښکته کړئ چیرې چې دا پیښیږي:

دا ماډل لوستل ساده متن، نو inline نښانونه په پام کې نه نيول کيږي. د نښان پر بنسټ احساس، د يو څرګند ماډل لکه Orpheus يا Bark بدل.

دوديزه لوستنه پېژندل (ويې = لوستنه):

-12 +12
0.5x 2.0x
د پيپر، VITS، MeloTTS سره وړيا
ستاسو توليد شوي غږيز به دلته ښکاره شي. يو ماډل وټاکئ، ليکنه وليکﺉ، او توليد کېکاږﺉ.
غږ په برياليتوب سره جوړ شو
0:00
غږيز رالېښنې .srt ډاونلوډ تړنه په 24h کې پای ته رسیږي
وړیا طبقه: شخصي کارولو. د $ 5 / mo څخه سوداګریز جواز
TTS.ai مینه؟ خپل ملګرو ته ووایاست!

په اړه CosyVoice3

CosyVoice3 is the newest generation from Alibaba's FunAudioLLM team and a clear step up from CosyVoice 2. It introduces bi-streaming inference with roughly 150ms latency and instruction-based control, letting you steer emotion, speed, and volume through prompts. Speaker similarity for zero-shot voice cloning is improved, and coverage spans 9 languages plus 18 Chinese dialects. An RL-tuned variant pushes prosody to a state-of-the-art level. With a 5,000-character ceiling, fast generation, and strong cloning, it's geared toward multilingual production TTS and real-time applications.

غوره د: Multilingual production TTS, real-time applications, voice cloning

ټول لټول CosyVoice3 غږونه

په يوه کتنه کې

جوړوونکی
Alibaba (FunAudioLLM)
منښتليک
Apache 2.0
:د پاڼې نوم
standard
چټکتيا
fast
غږ کلونول
هو
ژبې
English, Chinese, Japanese, Korean, German, Spanish, French, Italian, Russian
ټولوجګه لوښه
5000

CosyVoice3 غږونه

Chinese Female

Chinese
تلواله Female

Chinese Male

Chinese
تلواله Male

English Female

English
تلواله Female

English Male

English
تلواله Male

French Female

French
تلواله Female

German Female

German
تلواله Female

Italian Female

Italian
تلواله Female

Japanese Female

Japanese
تلواله Female

Korean Female

Korean
تلواله Female

Russian Female

Russian
تلواله Female

Spanish Female

Spanish
تلواله Female

CosyVoice3 د پوښتنو ځوابول

CosyVoice3 adds bi-streaming inference at around 150ms latency, instruction-based control over emotion/speed/volume, improved speaker similarity for cloning, and coverage of 9 languages plus 18 Chinese dialects, with an RL-tuned variant for state-of-the-art prosody.

Yes. It supports zero-shot voice cloning from a reference clip (around 3 seconds minimum) with improved speaker similarity over the previous generation.

Yes. CosyVoice3 is licensed under Apache 2.0, permitting commercial use.
← ټول غږونه