CosyVoice3

CosyVoice3 ТТС

Alibaba FunAudioLLM's latest multilingual model with ~150ms bi-streaming, instruction control, and zero-shot cloning.

Падпісацца Абмежаванне на 5000 знакаў

Захоўваць тэкст у тэгах SSML для дакладнага кантролю:

<speak><prosody rate="slow">Slow speech</prosody></speak>

Тэгі, якія разумее выбраная мадэль - націсніце, каб перанесці іх у тэкст:

Гэтая мадэль чытае звычайны тэкст, таму ўбудаваныя тэгі ігнаруюцца. Для эмоцый, заснаваных на тэгах, пераключыцеся на мадэлі выразнасці, такія як Orpheus або Bark.

Вызначыць уласнае вымаўленне (слова = вымаўленне):

-12 +12
0.5x 2.0x
Свабодны з Piper, VITS, MeloTTS
Створаны вамі гук з' явіцца тут. Выберыце мадэль, увядзіце тэкст і націсніце Стварыць.
Аўдыё паспяхова створанаName
0:00
Сцягнуць гук Сцягнуць.srt Тэрмін дзеяння спасылкі скончыцца праз 24 гадзіны
Любіце TTS.ai? Раскажыце сваім сябрам!

Пра CosyVoice3

CosyVoice3 is the newest generation from Alibaba's FunAudioLLM team and a clear step up from CosyVoice 2. It introduces bi-streaming inference with roughly 150ms latency and instruction-based control, letting you steer emotion, speed, and volume through prompts. Speaker similarity for zero-shot voice cloning is improved, and coverage spans 9 languages plus 18 Chinese dialects. An RL-tuned variant pushes prosody to a state-of-the-art level. With a 5,000-character ceiling, fast generation, and strong cloning, it's geared toward multilingual production TTS and real-time applications.

Лепшы для: Multilingual production TTS, real-time applications, voice cloning

Прагляд усіх CosyVoice3 галасы

Кароткае апісанне

Распрацоўшчык
Alibaba (FunAudioLLM)
Ліцэнзія
Apache 2.0
Стварыць
standard
Хуткасць
fast
Клонаванне голасу
Так
Мовы
English, Chinese, Japanese, Korean, German, Spanish, French, Italian, Russian
Найбольшая колькасць знакаў
5000

CosyVoice3 галасы

Chinese Female

Chinese
Па змаўчанні Female

Chinese Male

Chinese
Па змаўчанні Male

English Female

English
Па змаўчанні Female

English Male

English
Па змаўчанні Male

French Female

French
Па змаўчанні Female

German Female

German
Па змаўчанні Female

Italian Female

Italian
Па змаўчанні Female

Japanese Female

Japanese
Па змаўчанні Female

Korean Female

Korean
Па змаўчанні Female

Russian Female

Russian
Па змаўчанні Female

Spanish Female

Spanish
Па змаўчанні Female

CosyVoice3 Частыя пытанні

CosyVoice3 adds bi-streaming inference at around 150ms latency, instruction-based control over emotion/speed/volume, improved speaker similarity for cloning, and coverage of 9 languages plus 18 Chinese dialects, with an RL-tuned variant for state-of-the-art prosody.

Yes. It supports zero-shot voice cloning from a reference clip (around 3 seconds minimum) with improved speaker similarity over the previous generation.

Yes. CosyVoice3 is licensed under Apache 2.0, permitting commercial use.
← Усе галасы