CosyVoice3

CosyVoice3 TTS

Alibaba FunAudioLLM's latest multilingual model with ~150ms bi-streaming, instruction control, and zero-shot cloning.

תחתמי. עבור 5,000 מגבלה של תווים

לעטוף את הטקסט שלך בתגי SSML לשליטה מדויקת:

<speak><prosody rate="slow">Slow speech</prosody></speak>

שם התוויות של המודל הנבחר הוא □ לחץ כדי להפיל אחד לתוך הטקסט שלך שבו הוא קורה:

המודל הזה קורא טקסט רגיל, כך שמתעלמים מתגי ההצפנה של רגש מבוסס תג, עבור מודל אקספרסיבי כמו אורפיאוס או ברק.

הגדר הגייה מותאמת אישית (מילה = הגייה):

-12 +12
0.5x 2.0x
חינם עם פייפר, VITS, Melotts
הקול שנוצר יופיע כאן. בחר דגם, הזן טקסט, ולחץ על יצירתו.
הקול נוצר בהצלחה
0:00
הורד שמע הורדה. srt הלינק פג ב-24 שעות.
שורה חופשית: שימוש אישי. רישיון מסחרי מ-5/מו.
אוהב את ט.ט.ס.אי?

אודות CosyVoice3

CosyVoice3 is the newest generation from Alibaba's FunAudioLLM team and a clear step up from CosyVoice 2. It introduces bi-streaming inference with roughly 150ms latency and instruction-based control, letting you steer emotion, speed, and volume through prompts. Speaker similarity for zero-shot voice cloning is improved, and coverage spans 9 languages plus 18 Chinese dialects. An RL-tuned variant pushes prosody to a state-of-the-art level. With a 5,000-character ceiling, fast generation, and strong cloning, it's geared toward multilingual production TTS and real-time applications.

הטוב ביותר עבור: Multilingual production TTS, real-time applications, voice cloning

עיין בכל CosyVoice3 קולות

במבט חטוף

מפתח
Alibaba (FunAudioLLM)
רישיון
Apache 2.0
Tier
standard
מהירות
fast
שיבוט קולי
כן.
שפות
English, Chinese, Japanese, Korean, German, Spanish, French, Italian, Russian
תווים מרביים
5000

CosyVoice3 קולות

Chinese Female

Chinese
רגיל Female

Chinese Male

Chinese
רגיל Male

English Female

English
רגיל Female

English Male

English
רגיל Male

French Female

French
רגיל Female

German Female

German
רגיל Female

Italian Female

Italian
רגיל Female

Japanese Female

Japanese
רגיל Female

Korean Female

Korean
רגיל Female

Russian Female

Russian
רגיל Female

Spanish Female

Spanish
רגיל Female

CosyVoice3 TTS □ FAQ

CosyVoice3 adds bi-streaming inference at around 150ms latency, instruction-based control over emotion/speed/volume, improved speaker similarity for cloning, and coverage of 9 languages plus 18 Chinese dialects, with an RL-tuned variant for state-of-the-art prosody.

Yes. It supports zero-shot voice cloning from a reference clip (around 3 seconds minimum) with improved speaker similarity over the previous generation.

Yes. CosyVoice3 is licensed under Apache 2.0, permitting commercial use.
← כל הקולות