CosyVoice 2

CosyVoice 2 ТТС

Alibaba Tongyi Lab's streaming TTS reaching human-parity naturalness with near-zero latency and zero-shot cloning.

Подписывайся. для 5 000 символов

Заверните текст в SSML для точного контроля:

<speak><prosody rate="slow">Slow speech</prosody></speak>

Помечает выбранную модель, которая понимает — нажмите, чтобы выкинуть одну в ваш текст, где она случается:

Эта модель читает простой текст, поэтому встраиваемые метки игнорируются. Для эмоций на основе метки переключайтесь на экспрессивную модель, как Орфей или Барк.

Определить традиционные произношения (слово = произношение):

-12 +12
0.5x 2.0x
Бесплатно с Пайпер, VITS, MeloTTS
Ваш генерированный звук появится здесь. Выберите модель, введите текст и нажмите на Генератор.
Аудиовизна успешно генерирована
0:00
Загрузить звук Загрузка. st Ссылка истекает в 24 ч.
Свободный уровень: личное использование. Коммерческая лицензия из 5 долл. США/мо
Нравится TTS.ai? Расскажите друзьям!

О том, что CosyVoice 2

CosyVoice 2, from Alibaba's Tongyi Lab, was designed to make high-quality speech viable in real time. It uses a finite scalar quantization approach combined with flow matching to support streaming synthesis at extremely low latency, while reaching human-comparable naturalness that outperforms many commercial systems in subjective tests. Beyond quality, it offers zero-shot voice cloning from about 3 seconds of audio, cross-lingual synthesis, and fine-grained emotion control. Covering 8 languages with a 1,000-character cap, it's a strong fit for voice assistants, streaming TTS, and other real-time applications.

Лучший для: Real-time applications, streaming TTS, voice assistants

Просмотр CosyVoice 2 голоса

Взгляните.

Разработчик
Alibaba (Tongyi Lab)
Лицензия
Apache 2.0
Тяжелый
standard
Скорость
medium
Клонирование голоса
Выполнено
Знание языков
English, Chinese, Japanese, Korean, French, German, Italian, Spanish
Максимум символов
1000

CosyVoice 2 голоса

Chinese Female

Chinese
Стандартные Female

Chinese Male

Chinese
Стандартные Male

English Female

English
Стандартные Female

English Male

English
Стандартные Male

French Female

French
Стандартные Female

German Female

German
Стандартные Female

Italian Female

Italian
Стандартные Female

Japanese Female

Japanese
Стандартные Female

Korean Female

Korean
Стандартные Female

Spanish Female

Spanish
Стандартные Female

CosyVoice 2 TTS - FAQ

Yes. CosyVoice 2 uses finite scalar quantization for streaming synthesis at very low latency, which is what makes it suitable for voice assistants and real-time applications.

Yes. It offers zero-shot voice cloning from roughly 3 seconds of reference audio, plus cross-lingual synthesis and emotion control.

Yes. CosyVoice 2 is Apache 2.0 licensed. It supports 8 languages: English, Chinese, Japanese, Korean, French, German, Italian, and Spanish.
← Все голоса