CosyVoice3

CosyVoice3 音声翻訳

Alibaba FunAudioLLM's latest multilingual model with ~150ms bi-streaming, instruction control, and zero-shot cloning.

登録 5000文字の制限を設けました

SSML タグでテキストを囲み、正確な制御を行う:

<speak><prosody rate="slow">Slow speech</prosody></speak>

選択したモデルが理解するタグ - クリックしてテキストにドラッグします:

このモデルは単純テキストを読み込み、インラインタグは無視されます。タグベースの感情を表現するには、Orpheus や Bark のような表現モデルに切り替えてください。

カスタム発音を定義 (単語=発音):

-12 +12
0.5x 2.0x
ピパー、VITS、MeloTTS をフリーで使用
生成したオーディオがここに表示されます。モデルを選択し、テキストを入力して、生成をクリックします。
オーディオを作成しましたName
0:00
音声をダウンロード ダウンロード リンクは24時間で失効します
無料階級:個人用。 商用ライセンス $5/月から
これを自分の声にしよう 30秒で声をクローン
TTS.aiが気に入りましたか?友達に教えてあげましょう!

情報 CosyVoice3

CosyVoice3 is the newest generation from Alibaba's FunAudioLLM team and a clear step up from CosyVoice 2. It introduces bi-streaming inference with roughly 150ms latency and instruction-based control, letting you steer emotion, speed, and volume through prompts. Speaker similarity for zero-shot voice cloning is improved, and coverage spans 9 languages plus 18 Chinese dialects. An RL-tuned variant pushes prosody to a state-of-the-art level. With a 5,000-character ceiling, fast generation, and strong cloning, it's geared toward multilingual production TTS and real-time applications.

適合する: Multilingual production TTS, real-time applications, voice cloning

すべてブラウズ CosyVoice3 声

概要

開発者
Alibaba (FunAudioLLM)
ライセンス
Apache 2.0
動物
standard
スピード
fast
声のクローン
はい
言語
English, Chinese, Japanese, Korean, German, Spanish, French, Italian, Russian
最大文字数
5000

CosyVoice3 声

Chinese Female

Chinese
標準 Female

Chinese Male

Chinese
標準 Male

English Female

English
標準 Female

English Male

English
標準 Male

French Female

French
標準 Female

German Female

German
標準 Female

Italian Female

Italian
標準 Female

Japanese Female

Japanese
標準 Female

Korean Female

Korean
標準 Female

Russian Female

Russian
標準 Female

Spanish Female

Spanish
標準 Female

CosyVoice3 よくある質問

CosyVoice3 adds bi-streaming inference at around 150ms latency, instruction-based control over emotion/speed/volume, improved speaker similarity for cloning, and coverage of 9 languages plus 18 Chinese dialects, with an RL-tuned variant for state-of-the-art prosody.

Yes. It supports zero-shot voice cloning from a reference clip (around 3 seconds minimum) with improved speaker similarity over the previous generation.

Yes. CosyVoice3 is licensed under Apache 2.0, permitting commercial use.
← すべての声