CosyVoice3

CosyVoice3 TTS

Alibaba FunAudioLLM's latest multilingual model with ~150ms bi-streaming, instruction control, and zero-shot cloning.

Signa per 5000 caràcters límit

Ajusta el text a les etiquetes SSML per al control precís:

<speak><prosody rate="slow">Slow speech</prosody></speak>

Etiquetes del model seleccionat entenen el clic show clic per a deixar- ne un al text a on succeeix:

Aquest model llegeix text pla, així que les etiquetes inserides s' ignoren. Per a emocions basades en etiquetes, canvieu a un model expressiu com Orfeus o Bark.

Defineix pronúncies personalitzades (word = pronunciació):

-12 +12
0.5x 2.0x
Lliure amb Pipista, VITS, MeloTTS
Aquí apareixerà el vostre àudio generat. Escolliu un model, introduïu text i cliqueu Genera.
L' àudio s' ha generat correctament
0:00
Descarrega àudio Descarrega.srt L' enllaç expirarà el 24h
Correlitzador lliure: ús personal. Llicència de venda de 5/mo
Fes que això sigui la teva pròpia veu Clona una veu en 30 segons
Els teus amics!

Quant a CosyVoice3

CosyVoice3 is the newest generation from Alibaba's FunAudioLLM team and a clear step up from CosyVoice 2. It introduces bi-streaming inference with roughly 150ms latency and instruction-based control, letting you steer emotion, speed, and volume through prompts. Speaker similarity for zero-shot voice cloning is improved, and coverage spans 9 languages plus 18 Chinese dialects. An RL-tuned variant pushes prosody to a state-of-the-art level. With a 5,000-character ceiling, fast generation, and strong cloning, it's geared toward multilingual production TTS and real-time applications.

Millor per: Multilingual production TTS, real-time applications, voice cloning

Navega- ho tot CosyVoice3 veus

En una mirada

Desenvolupador
Alibaba (FunAudioLLM)
Llicència
Apache 2.0
TierCity name (optional, probably does not need a translation)
standard
Velocitat
fast
clonació de veu
Idiomes
English, Chinese, Japanese, Korean, German, Spanish, French, Italian, Russian
Nombre màxim de caràcters
5000

CosyVoice3 veus

Chinese Female

Chinese
Estàndard Female

Chinese Male

Chinese
Estàndard Male

English Female

English
Estàndard Female

English Male

English
Estàndard Male

French Female

French
Estàndard Female

German Female

German
Estàndard Female

Italian Female

Italian
Estàndard Female

Japanese Female

Japanese
Estàndard Female

Korean Female

Korean
Estàndard Female

Russian Female

Russian
Estàndard Female

Spanish Female

Spanish
Estàndard Female

CosyVoice3 PMF TTS

CosyVoice3 adds bi-streaming inference at around 150ms latency, instruction-based control over emotion/speed/volume, improved speaker similarity for cloning, and coverage of 9 languages plus 18 Chinese dialects, with an RL-tuned variant for state-of-the-art prosody.

Yes. It supports zero-shot voice cloning from a reference clip (around 3 seconds minimum) with improved speaker similarity over the previous generation.

Yes. CosyVoice3 is licensed under Apache 2.0, permitting commercial use.
← Totes les veus