CosyVoice3

CosyVoice3 TTS

Alibaba FunAudioLLM's latest multilingual model with ~150ms bi-streaming, instruction control, and zero-shot cloning.

Vpišite se. za 5000 mejnih vrednosti znakov

Za natančen nadzor zavijte svoje besedilo v oznake SSML:

<speak><prosody rate="slow">Slow speech</prosody></speak>

Oznake izbranega modela razume – kliknite, da spustite enega v svoje besedilo, kjer se zgodi:

Ta model bere navadno besedilo, zato se v vrstici ignorirajo. Za čustva, ki temeljijo na tag, preklopite na izražen model, kot je Orfeus ali Bark.

Opredelitev posebnih izgovorov (beseda = izgovor):

-12 +12
0.5x 2.0x
Brez Piper, VITS, Melotts
Tukaj se bo pojavil vaš ustvarjeni zvok. Izberite model, vnesite besedilo in kliknite Generiraj.
Uspešno ustvarjen zvok
0:00
Prenesi zvok Prenesi.rt Povezava poteče čez 24h
Brezplačna stopnja: osebna uporaba. Trgovska licenca od 5 $/mo
Ljubi TTS.ai, povej prijateljem!

O projektu CosyVoice3

CosyVoice3 is the newest generation from Alibaba's FunAudioLLM team and a clear step up from CosyVoice 2. It introduces bi-streaming inference with roughly 150ms latency and instruction-based control, letting you steer emotion, speed, and volume through prompts. Speaker similarity for zero-shot voice cloning is improved, and coverage spans 9 languages plus 18 Chinese dialects. An RL-tuned variant pushes prosody to a state-of-the-art level. With a 5,000-character ceiling, fast generation, and strong cloning, it's geared toward multilingual production TTS and real-time applications.

Najboljše za: Multilingual production TTS, real-time applications, voice cloning

Brskaj vse CosyVoice3 glasovi

Na pogled

Razvijalec
Alibaba (FunAudioLLM)
Licenca
Apache 2.0
Stopnja
standard
Hitrost
fast
kloniranje glasu
Da, da.
Jeziki
English, Chinese, Japanese, Korean, German, Spanish, French, Italian, Russian
Največ znakov
5000

CosyVoice3 glasovi

Chinese Female

Chinese
Standardno Female

Chinese Male

Chinese
Standardno Male

English Female

English
Standardno Female

English Male

English
Standardno Male

French Female

French
Standardno Female

German Female

German
Standardno Female

Italian Female

Italian
Standardno Female

Japanese Female

Japanese
Standardno Female

Korean Female

Korean
Standardno Female

Russian Female

Russian
Standardno Female

Spanish Female

Spanish
Standardno Female

CosyVoice3 TTS – Pogosta vprašanja

CosyVoice3 adds bi-streaming inference at around 150ms latency, instruction-based control over emotion/speed/volume, improved speaker similarity for cloning, and coverage of 9 languages plus 18 Chinese dialects, with an RL-tuned variant for state-of-the-art prosody.

Yes. It supports zero-shot voice cloning from a reference clip (around 3 seconds minimum) with improved speaker similarity over the previous generation.

Yes. CosyVoice3 is licensed under Apache 2.0, permitting commercial use.
← Vsi glasovi