CosyVoice 2

CosyVoice 2 ТТС

Alibaba Tongyi Lab's streaming TTS reaching human-parity naturalness with near-zero latency and zero-shot cloning.

Запиши се. за 5000 ограничаване на знака

Опаковка на вашия текст в SSML тагове за точен контрол:

<speak><prosody rate="slow">Slow speech</prosody></speak>

Етикети избрания модел разбира — кликнете за да пуснете един в вашия текст, където се случва:

Този модел чете обикновен текст, така че в линия тагове се пренебрегват. За емоции, базирани на таг, превключете на експресивен модел като Orpheus или Bark.

Определяне на своите изговори (слово = произношение):

-12 +12
0.5x 2.0x
Без пари с Пайпър, ВИТС, Мелотс
Тук ще се появи генерираното ви аудио. Изберете модел, въведете текст и кликнете върху Генериране.
Аудио генерирано успешно
0:00
Изтегляне на аудиото Сваляне.rt. Връзката изтича след 24 часа
Безплатен ступенят: лично използване. Търговска лиценз от $5/мо
Обичай ТТСай, кажи на приятелите си!

За CosyVoice 2

CosyVoice 2, from Alibaba's Tongyi Lab, was designed to make high-quality speech viable in real time. It uses a finite scalar quantization approach combined with flow matching to support streaming synthesis at extremely low latency, while reaching human-comparable naturalness that outperforms many commercial systems in subjective tests. Beyond quality, it offers zero-shot voice cloning from about 3 seconds of audio, cross-lingual synthesis, and fine-grained emotion control. Covering 8 languages with a 1,000-character cap, it's a strong fit for voice assistants, streaming TTS, and other real-time applications.

Най-добро за: Real-time applications, streaming TTS, voice assistants

Преглед на всички CosyVoice 2 гласове

На един поглед.

Разработчик
Alibaba (Tongyi Lab)
Лиценз
Apache 2.0
Ниво на равнището
standard
Скорост
medium
Гласово клониране
Да.
Езици
English, Chinese, Japanese, Korean, French, German, Italian, Spanish
Макс. символи
1000

CosyVoice 2 гласове

Chinese Female

Chinese
Стандартен Female

Chinese Male

Chinese
Стандартен Male

English Female

English
Стандартен Female

English Male

English
Стандартен Male

French Female

French
Стандартен Female

German Female

German
Стандартен Female

Italian Female

Italian
Стандартен Female

Japanese Female

Japanese
Стандартен Female

Korean Female

Korean
Стандартен Female

Spanish Female

Spanish
Стандартен Female

CosyVoice 2 TTS — Често задавани въпроси

Yes. CosyVoice 2 uses finite scalar quantization for streaming synthesis at very low latency, which is what makes it suitable for voice assistants and real-time applications.

Yes. It offers zero-shot voice cloning from roughly 3 seconds of reference audio, plus cross-lingual synthesis and emotion control.

Yes. CosyVoice 2 is Apache 2.0 licensed. It supports 8 languages: English, Chinese, Japanese, Korean, French, German, Italian, and Spanish.
← Всички гласове.