CosyVoice 2

CosyVoice 2 ТТС

Alibaba Tongyi Lab's streaming TTS reaching human-parity naturalness with near-zero latency and zero-shot cloning.

Упиши се за ограничење 5.000 знакова

Умотајте текст у ССМЛ ознаке за прецизну контролу:

<speak><prosody rate="slow">Slow speech</prosody></speak>

Означе изабрани модел разуме — кликните да га испустите у текст где се то дешава:

Овај модел чита обичан текст, па се ознаке за успостављене на линији игноришу. За емоције засноване на ознакама пребаците на изражавајући модел попут Орфеја или Барка.

Дефинишите посебне изговоре (слов = изговор):

-12 +12
0.5x 2.0x
Слободна са Пајпер, Витс, Мелоттс
Овд› је ће се појавити генерисани звук. Изаберите модел, унесите текст и кликните на Генериши.
аудио генерисано усп› јешно
0:00
Преузми аудио Преузми.рт Веза истекава за 24х
Слободни ниво: лично коришћење. Комерцијална дозвола од 5 долара/мо
Нека ово буде твој глас Клонирај глас за 30 секунди
Љубав ТТС.аи?

О CosyVoice 2

CosyVoice 2, from Alibaba's Tongyi Lab, was designed to make high-quality speech viable in real time. It uses a finite scalar quantization approach combined with flow matching to support streaming synthesis at extremely low latency, while reaching human-comparable naturalness that outperforms many commercial systems in subjective tests. Beyond quality, it offers zero-shot voice cloning from about 3 seconds of audio, cross-lingual synthesis, and fine-grained emotion control. Covering 8 languages with a 1,000-character cap, it's a strong fit for voice assistants, streaming TTS, and other real-time applications.

Најбоље за: Real-time applications, streaming TTS, voice assistants

Прегледај све CosyVoice 2 гласови

На један поглед

Програмер
Alibaba (Tongyi Lab)
Лиценца
Apache 2.0
Низ
standard
Брзина
medium
Гласово клонирање
Да.
језици
English, Chinese, Japanese, Korean, French, German, Italian, Spanish
Макс. знакова
1000

CosyVoice 2 гласови

Chinese Female

Chinese
стандардни Female

Chinese Male

Chinese
стандардни Male

English Female

English
стандардни Female

English Male

English
стандардни Male

French Female

French
стандардни Female

German Female

German
стандардни Female

Italian Female

Italian
стандардни Female

Japanese Female

Japanese
стандардни Female

Korean Female

Korean
стандардни Female

Spanish Female

Spanish
стандардни Female

CosyVoice 2 ТТС — честа питања

Yes. CosyVoice 2 uses finite scalar quantization for streaming synthesis at very low latency, which is what makes it suitable for voice assistants and real-time applications.

Yes. It offers zero-shot voice cloning from roughly 3 seconds of reference audio, plus cross-lingual synthesis and emotion control.

Yes. CosyVoice 2 is Apache 2.0 licensed. It supports 8 languages: English, Chinese, Japanese, Korean, French, German, Italian, and Spanish.
← Сви гласови