CosyVoice3

CosyVoice3 ТТС

Alibaba FunAudioLLM's latest multilingual model with ~150ms bi-streaming, instruction control, and zero-shot cloning.

Бақайдгирӣ барои 5000 аломат маҳдудият

Матнро дар SSML тегҳо барои идоракунии дақиқ гузоред:

<speak><prosody rate="slow">Slow speech</prosody></speak>

Барчаспҳо, ки аз тарафи намунаи интихобшуда фаҳмида мешаванд - барои гузоштани яке аз онҳо дар матни худ, ки дар он ҷо рӯй медиҳад, пахш кунед:

Ин намуна матни оддиро мехонад, аз ин рӯ, нишонаҳои дар сатр бударо нодида мегиранд. Барои нишонаҳои асосӣ ба намунаи ифодакунандаи Orpheus ё Bark гузаред.

Муайян кардани талаффузи оддӣ (калима = талаффуз):

-12 +12
0.5x 2.0x
Озод бо Piper, VITS, MeloTTS
Дар ин ҷо садои эҷодшудаи шумо пайдо мешавад. Намунаро интихоб кунед, матнро ворид кунед ва пахш кунед Эҷод кунед.
Аудио бо муваффақият эҷод шуд
0:00
Боргирии аудио Боргирӣ Мӯҳлати пайванд баъди 24 соат ба итмом мерасад
Шаблон:Шаҳристон Лицензияи тиҷоратӣ аз $5/мо
Ин овозро овози худ созед Нусхаи овоз дар 30 сония
Шумо TTS.ai-ро дӯст медоред? Ба дӯстонатон бигӯед!

Дар бораи CosyVoice3

CosyVoice3 is the newest generation from Alibaba's FunAudioLLM team and a clear step up from CosyVoice 2. It introduces bi-streaming inference with roughly 150ms latency and instruction-based control, letting you steer emotion, speed, and volume through prompts. Speaker similarity for zero-shot voice cloning is improved, and coverage spans 9 languages plus 18 Chinese dialects. An RL-tuned variant pushes prosody to a state-of-the-art level. With a 5,000-character ceiling, fast generation, and strong cloning, it's geared toward multilingual production TTS and real-time applications.

Беҳтарин барои: Multilingual production TTS, real-time applications, voice cloning

Баррасии ҳама CosyVoice3 овозҳо

Дар як назар

Тайёркунанда
Alibaba (FunAudioLLM)
Иҷозатнома
Apache 2.0
& Тағйиротҳо
standard
Суръат
fast
Тасвири овоз
& Тасвир
Забонҳо
English, Chinese, Japanese, Korean, German, Spanish, French, Italian, Russian
Аломатҳои зиёд
5000

CosyVoice3 овозҳо

Chinese Female

Chinese
& Стандартӣ Female

Chinese Male

Chinese
& Стандартӣ Male

English Female

English
& Стандартӣ Female

English Male

English
& Стандартӣ Male

French Female

French
& Стандартӣ Female

German Female

German
& Стандартӣ Female

Italian Female

Italian
& Стандартӣ Female

Japanese Female

Japanese
& Стандартӣ Female

Korean Female

Korean
& Стандартӣ Female

Russian Female

Russian
& Стандартӣ Female

Spanish Female

Spanish
& Стандартӣ Female

CosyVoice3 Саволҳои зиёд

CosyVoice3 adds bi-streaming inference at around 150ms latency, instruction-based control over emotion/speed/volume, improved speaker similarity for cloning, and coverage of 9 languages plus 18 Chinese dialects, with an RL-tuned variant for state-of-the-art prosody.

Yes. It supports zero-shot voice cloning from a reference clip (around 3 seconds minimum) with improved speaker similarity over the previous generation.

CosyVoice3 is licensed under Apache 2.0. On TTS.ai, audio you make with it is for personal use on the free tier and can be used commercially on any paid plan.
← Ҳамаи овозҳо