CosyVoice3

CosyVoice3 TTS

Alibaba FunAudioLLM's latest multilingual model with ~150ms bi-streaming, instruction control, and zero-shot cloning.

Qeyd Et 5,000 karakter həddi

Düzgün idarə üçün mətninizi SSML lentlərinə sarılın:

<speak><prosody rate="slow">Slow speech</prosody></speak>

Seçilmiş modelin anladığı etiketlər - mətninizi mətn daxilində buraxmaq üçün basın:

Bu model sadə mətn oxuyur, buna görə də sətir içi təqvimlər nəzərə alınmır. təqvim əsaslı hisslər üçün Orpheus və ya Bark kimi ifadəli modellərə keçin.

Özəl səsləndirmələri təsvir et (söz = səsləndirmə):

-12 +12
0.5x 2.0x
Piper, VITS, MeloTTS ilə pulsuz
Yaratdığınız səs burada görünəcək. Bir model seçin, mətni daxil edin və Yarat düyməsini basın.
Audio müvəffəqiyyətlə yaradıldı
0:00
Audio endirilsin Yüklə Körpünün müddəti 24 saat ərzində başa çatır
Free tier: şəxsi istifadə üçün. $5/mo-dan ticarət lisenziyası
TTS.ai-ni sevirsiniz? Dostlarınıza deyin!

Bağlan CosyVoice3

CosyVoice3 is the newest generation from Alibaba's FunAudioLLM team and a clear step up from CosyVoice 2. It introduces bi-streaming inference with roughly 150ms latency and instruction-based control, letting you steer emotion, speed, and volume through prompts. Speaker similarity for zero-shot voice cloning is improved, and coverage spans 9 languages plus 18 Chinese dialects. An RL-tuned variant pushes prosody to a state-of-the-art level. With a 5,000-character ceiling, fast generation, and strong cloning, it's geared toward multilingual production TTS and real-time applications.

Ən Yaxşı: Multilingual production TTS, real-time applications, voice cloning

Hamısını Gəz CosyVoice3 səslər

Bir baxışda

Yaradıcı
Alibaba (FunAudioLLM)
Lisenziya
Apache 2.0
Tərcümə
standard
Sür'ət
fast
Sesi təkrarla
Bəli
Dillər
English, Chinese, Japanese, Korean, German, Spanish, French, Italian, Russian
Max karakterlər
5000

CosyVoice3 səslər

Chinese Female

Chinese
Əsas Female

Chinese Male

Chinese
Əsas Male

English Female

English
Əsas Female

English Male

English
Əsas Male

French Female

French
Əsas Female

German Female

German
Əsas Female

Italian Female

Italian
Əsas Female

Japanese Female

Japanese
Əsas Female

Korean Female

Korean
Əsas Female

Russian Female

Russian
Əsas Female

Spanish Female

Spanish
Əsas Female

CosyVoice3 TTS — FAQ

CosyVoice3 adds bi-streaming inference at around 150ms latency, instruction-based control over emotion/speed/volume, improved speaker similarity for cloning, and coverage of 9 languages plus 18 Chinese dialects, with an RL-tuned variant for state-of-the-art prosody.

Yes. It supports zero-shot voice cloning from a reference clip (around 3 seconds minimum) with improved speaker similarity over the previous generation.

Yes. CosyVoice3 is licensed under Apache 2.0, permitting commercial use.
← Bütün səslər