CosyVoice3

CosyVoice3 TTS

Alibaba FunAudioLLM's latest multilingual model with ~150ms bi-streaming, instruction control, and zero-shot cloning.

Prihlásiť sa na odber Limit 5 000 znakov

Zabaliť text do SSML značiek pre presnú kontrolu:

<speak><prosody rate="slow">Slow speech</prosody></speak>

Značky, ktorým vybraný model rozumie — kliknutím ich umiestnite do textu tam, kde sa vyskytujú:

Tento model číta obyčajný text, takže vnorené značky sa ignorujú.Pre emócie založené na značkách prejdite na expresívny model ako Orpheus alebo Bark.

Definovať vlastné výslovnosti (slovo = výslovnosť):

-12 +12
0.5x 2.0x
Zadarmo s Piper, VITS, MeloTTS
Vyberte si model, zadajte text a kliknite na tlačidlo Generovať.Generate.
Audio generované úspešne
0:00
Stiahnuť audio na stiahnutie Stiahnuť.srt súbor Platnosť odkazu vyprší za 24h
Bezplatná úroveň: osobné použitie. Komerčná licencia od 5 USD/mesiac
Láska TTS.ai? Povedzte svojim priateľom!

O nás CosyVoice3

CosyVoice3 is the newest generation from Alibaba's FunAudioLLM team and a clear step up from CosyVoice 2. It introduces bi-streaming inference with roughly 150ms latency and instruction-based control, letting you steer emotion, speed, and volume through prompts. Speaker similarity for zero-shot voice cloning is improved, and coverage spans 9 languages plus 18 Chinese dialects. An RL-tuned variant pushes prosody to a state-of-the-art level. With a 5,000-character ceiling, fast generation, and strong cloning, it's geared toward multilingual production TTS and real-time applications.

Najlepšie pre: Multilingual production TTS, real-time applications, voice cloning

Prehľadávať všetky CosyVoice3 hlasy

Na prvý pohľad

Vývojár
Alibaba (FunAudioLLM)
Licencia
Apache 2.0
Zvieratá
standard
Rýchlosť
fast
Klonovanie hlasu
Áno
Jazyky
English, Chinese, Japanese, Korean, German, Spanish, French, Italian, Russian
Max. počet znakov
5000

CosyVoice3 hlasy

Chinese Female

Chinese
Štandardné Female

Chinese Male

Chinese
Štandardné Male

English Female

English
Štandardné Female

English Male

English
Štandardné Male

French Female

French
Štandardné Female

German Female

German
Štandardné Female

Italian Female

Italian
Štandardné Female

Japanese Female

Japanese
Štandardné Female

Korean Female

Korean
Štandardné Female

Russian Female

Russian
Štandardné Female

Spanish Female

Spanish
Štandardné Female

CosyVoice3 TTS — Často kladené otázky

CosyVoice3 adds bi-streaming inference at around 150ms latency, instruction-based control over emotion/speed/volume, improved speaker similarity for cloning, and coverage of 9 languages plus 18 Chinese dialects, with an RL-tuned variant for state-of-the-art prosody.

Yes. It supports zero-shot voice cloning from a reference clip (around 3 seconds minimum) with improved speaker similarity over the previous generation.

Yes. CosyVoice3 is licensed under Apache 2.0, permitting commercial use.
← Všetky hlasy