CosyVoice 2

CosyVoice 2 TTS

Alibaba Tongyi Lab's streaming TTS reaching human-parity naturalness with near-zero latency and zero-shot cloning.

Zaregistrovat se pro 5000 znaků limit

Zabalte svůj text do značek SSML pro přesné ovládání:

<speak><prosody rate="slow">Slow speech</prosody></speak>

Značky vybraného modelu rozumí? klikněte na tlačítko pro kapku jednoho do textu, kde se to stane:

Tento model čte prostý text, takže inline značky jsou ignorovány. Pro tag-based emotion, přepněte na expresivní model, jako je Orpheus nebo Bark.

Definovat vlastní výslovnosti (slovo = výslovnost):

-12 +12
0.5x 2.0x
Zdarma s Piper, VITS, MeloTTS
Zde se objeví váš vygenerovaný zvuk. Vyberte model, zadejte text a klikněte na Generovat.
Audio generované úspěšně
0:00
Stáhnout zvuk Stáhnout.srt Odkaz vyprší v 24 hodin
Volný stupeň: osobní použití. Obchodní licence od 5 dolarů/mo
Miluju TTS.ai? Řekni to svým přátelům!

O aplikaci CosyVoice 2

CosyVoice 2, from Alibaba's Tongyi Lab, was designed to make high-quality speech viable in real time. It uses a finite scalar quantization approach combined with flow matching to support streaming synthesis at extremely low latency, while reaching human-comparable naturalness that outperforms many commercial systems in subjective tests. Beyond quality, it offers zero-shot voice cloning from about 3 seconds of audio, cross-lingual synthesis, and fine-grained emotion control. Covering 8 languages with a 1,000-character cap, it's a strong fit for voice assistants, streaming TTS, and other real-time applications.

Nejlepší pro: Real-time applications, streaming TTS, voice assistants

Procházet vše CosyVoice 2 hlasy

Na první pohled

Vývojář
Alibaba (Tongyi Lab)
Licence
Apache 2.0
Úroveň
standard
Rychlost
medium
Klonování hlasu
Ano.
Jazyky
English, Chinese, Japanese, Korean, French, German, Italian, Spanish
Max znaků
1000

CosyVoice 2 hlasy

Chinese Female

Chinese
Standardní Female

Chinese Male

Chinese
Standardní Male

English Female

English
Standardní Female

English Male

English
Standardní Male

French Female

French
Standardní Female

German Female

German
Standardní Female

Italian Female

Italian
Standardní Female

Japanese Female

Japanese
Standardní Female

Korean Female

Korean
Standardní Female

Spanish Female

Spanish
Standardní Female

CosyVoice 2 FAQ TTS

Yes. CosyVoice 2 uses finite scalar quantization for streaming synthesis at very low latency, which is what makes it suitable for voice assistants and real-time applications.

Yes. It offers zero-shot voice cloning from roughly 3 seconds of reference audio, plus cross-lingual synthesis and emotion control.

Yes. CosyVoice 2 is Apache 2.0 licensed. It supports 8 languages: English, Chinese, Japanese, Korean, French, German, Italian, and Spanish.
← Všechny hlasy