CosyVoice3

CosyVoice3 ТТС

Alibaba FunAudioLLM's latest multilingual model with ~150ms bi-streaming, instruction control, and zero-shot cloning.

Запиши се. за 5000 ограничаване на знака

Опаковка на вашия текст в SSML тагове за точен контрол:

<speak><prosody rate="slow">Slow speech</prosody></speak>

Етикети избрания модел разбира — кликнете за да пуснете един в вашия текст, където се случва:

Този модел чете обикновен текст, така че в линия тагове се пренебрегват. За емоции, базирани на таг, превключете на експресивен модел като Orpheus или Bark.

Определяне на своите изговори (слово = произношение):

-12 +12
0.5x 2.0x
Без пари с Пайпър, ВИТС, Мелотс
Тук ще се появи генерираното ви аудио. Изберете модел, въведете текст и кликнете върху Генериране.
Аудио генерирано успешно
0:00
Изтегляне на аудиото Сваляне.rt. Връзката изтича след 24 часа
Безплатен ступенят: лично използване. Търговска лиценз от $5/мо
Обичай ТТСай, кажи на приятелите си!

За CosyVoice3

CosyVoice3 is the newest generation from Alibaba's FunAudioLLM team and a clear step up from CosyVoice 2. It introduces bi-streaming inference with roughly 150ms latency and instruction-based control, letting you steer emotion, speed, and volume through prompts. Speaker similarity for zero-shot voice cloning is improved, and coverage spans 9 languages plus 18 Chinese dialects. An RL-tuned variant pushes prosody to a state-of-the-art level. With a 5,000-character ceiling, fast generation, and strong cloning, it's geared toward multilingual production TTS and real-time applications.

Най-добро за: Multilingual production TTS, real-time applications, voice cloning

Преглед на всички CosyVoice3 гласове

На един поглед.

Разработчик
Alibaba (FunAudioLLM)
Лиценз
Apache 2.0
Ниво на равнището
standard
Скорост
fast
Гласово клониране
Да.
Езици
English, Chinese, Japanese, Korean, German, Spanish, French, Italian, Russian
Макс. символи
5000

CosyVoice3 гласове

Chinese Female

Chinese
Стандартен Female

Chinese Male

Chinese
Стандартен Male

English Female

English
Стандартен Female

English Male

English
Стандартен Male

French Female

French
Стандартен Female

German Female

German
Стандартен Female

Italian Female

Italian
Стандартен Female

Japanese Female

Japanese
Стандартен Female

Korean Female

Korean
Стандартен Female

Russian Female

Russian
Стандартен Female

Spanish Female

Spanish
Стандартен Female

CosyVoice3 TTS — Често задавани въпроси

CosyVoice3 adds bi-streaming inference at around 150ms latency, instruction-based control over emotion/speed/volume, improved speaker similarity for cloning, and coverage of 9 languages plus 18 Chinese dialects, with an RL-tuned variant for state-of-the-art prosody.

Yes. It supports zero-shot voice cloning from a reference clip (around 3 seconds minimum) with improved speaker similarity over the previous generation.

Yes. CosyVoice3 is licensed under Apache 2.0, permitting commercial use.
← Всички гласове.