CosyVoice3

CosyVoice3 TTS

Alibaba FunAudioLLM's latest multilingual model with ~150ms bi-streaming, instruction control, and zero-shot cloning.

Upišite se za 5000 ograničenja znakova

Umotaj svoj tekst u SSML oznake za preciznu kontrolu:

<speak><prosody rate="slow">Slow speech</prosody></speak>

Oznake odabrani model razumije — kliknite da bacite jedan u vaš tekst gdje se to događa:

Ovaj model čita običan tekst, tako da inline oznake se zanemaruju. Za tag-based emocije, prebaci na ekspresivni model kao što su Orfeus ili Bark.

Definiši vlastite izgovore (riječ = izgovor):

-12 +12
0.5x 2.0x
Besplatno s Piper, VITS, Melotts
Ovdje će se pojaviti vaš generirani zvuk. Odaberite model, unesite tekst i kliknite Generirati.
Zvučni generisan uspješno
0:00
Preuzmi zvuk Preuzmite.rt Veza isteče za 24 sata
Besplatna uporaba: osobna upotreba. Komercijalna licenca od $5/mo
Reci svojim prijateljima!

O CosyVoice3

CosyVoice3 is the newest generation from Alibaba's FunAudioLLM team and a clear step up from CosyVoice 2. It introduces bi-streaming inference with roughly 150ms latency and instruction-based control, letting you steer emotion, speed, and volume through prompts. Speaker similarity for zero-shot voice cloning is improved, and coverage spans 9 languages plus 18 Chinese dialects. An RL-tuned variant pushes prosody to a state-of-the-art level. With a 5,000-character ceiling, fast generation, and strong cloning, it's geared toward multilingual production TTS and real-time applications.

Najbolje za: Multilingual production TTS, real-time applications, voice cloning

Pregledaj sve CosyVoice3 glasovi

Na jedan pogled

Programer
Alibaba (FunAudioLLM)
Dozvola
Apache 2.0
Nivo
standard
Brzina
fast
Kloniranje glasa
-Da.
Jezici
English, Chinese, Japanese, Korean, German, Spanish, French, Italian, Russian
Maks. znakova
5000

CosyVoice3 glasovi

Chinese Female

Chinese
Standardno Female

Chinese Male

Chinese
Standardno Male

English Female

English
Standardno Female

English Male

English
Standardno Male

French Female

French
Standardno Female

German Female

German
Standardno Female

Italian Female

Italian
Standardno Female

Japanese Female

Japanese
Standardno Female

Korean Female

Korean
Standardno Female

Russian Female

Russian
Standardno Female

Spanish Female

Spanish
Standardno Female

CosyVoice3 TTS – FAQ

CosyVoice3 adds bi-streaming inference at around 150ms latency, instruction-based control over emotion/speed/volume, improved speaker similarity for cloning, and coverage of 9 languages plus 18 Chinese dialects, with an RL-tuned variant for state-of-the-art prosody.

Yes. It supports zero-shot voice cloning from a reference clip (around 3 seconds minimum) with improved speaker similarity over the previous generation.

Yes. CosyVoice3 is licensed under Apache 2.0, permitting commercial use.
← Svi glasovi