CosyVoice 2

CosyVoice 2 ТТС

Alibaba Tongyi Lab's streaming TTS reaching human-parity naturalness with near-zero latency and zero-shot cloning.

Падпісацца Абмежаванне на 5000 знакаў

Захоўваць тэкст у тэгах SSML для дакладнага кантролю:

<speak><prosody rate="slow">Slow speech</prosody></speak>

Тэгі, якія разумее выбраная мадэль - націсніце, каб перанесці іх у тэкст:

Гэтая мадэль чытае звычайны тэкст, таму ўбудаваныя тэгі ігнаруюцца. Для эмоцый, заснаваных на тэгах, пераключыцеся на мадэлі выразнасці, такія як Orpheus або Bark.

Вызначыць уласнае вымаўленне (слова = вымаўленне):

-12 +12
0.5x 2.0x
Свабодны з Piper, VITS, MeloTTS
Створаны вамі гук з' явіцца тут. Выберыце мадэль, увядзіце тэкст і націсніце Стварыць.
Аўдыё паспяхова створанаName
0:00
Сцягнуць гук Сцягнуць.srt Тэрмін дзеяння спасылкі скончыцца праз 24 гадзіны
Любіце TTS.ai? Раскажыце сваім сябрам!

Пра CosyVoice 2

CosyVoice 2, from Alibaba's Tongyi Lab, was designed to make high-quality speech viable in real time. It uses a finite scalar quantization approach combined with flow matching to support streaming synthesis at extremely low latency, while reaching human-comparable naturalness that outperforms many commercial systems in subjective tests. Beyond quality, it offers zero-shot voice cloning from about 3 seconds of audio, cross-lingual synthesis, and fine-grained emotion control. Covering 8 languages with a 1,000-character cap, it's a strong fit for voice assistants, streaming TTS, and other real-time applications.

Лепшы для: Real-time applications, streaming TTS, voice assistants

Прагляд усіх CosyVoice 2 галасы

Кароткае апісанне

Распрацоўшчык
Alibaba (Tongyi Lab)
Ліцэнзія
Apache 2.0
Стварыць
standard
Хуткасць
medium
Клонаванне голасу
Так
Мовы
English, Chinese, Japanese, Korean, French, German, Italian, Spanish
Найбольшая колькасць знакаў
1000

CosyVoice 2 галасы

Chinese Female

Chinese
Па змаўчанні Female

Chinese Male

Chinese
Па змаўчанні Male

English Female

English
Па змаўчанні Female

English Male

English
Па змаўчанні Male

French Female

French
Па змаўчанні Female

German Female

German
Па змаўчанні Female

Italian Female

Italian
Па змаўчанні Female

Japanese Female

Japanese
Па змаўчанні Female

Korean Female

Korean
Па змаўчанні Female

Spanish Female

Spanish
Па змаўчанні Female

CosyVoice 2 Частыя пытанні

Yes. CosyVoice 2 uses finite scalar quantization for streaming synthesis at very low latency, which is what makes it suitable for voice assistants and real-time applications.

Yes. It offers zero-shot voice cloning from roughly 3 seconds of reference audio, plus cross-lingual synthesis and emotion control.

Yes. CosyVoice 2 is Apache 2.0 licensed. It supports 8 languages: English, Chinese, Japanese, Korean, French, German, Italian, and Spanish.
← Усе галасы