CosyVoice 2

CosyVoice 2 เสียง

Alibaba Tongyi Lab's streaming TTS reaching human-parity naturalness with near-zero latency and zero-shot cloning.

ลงทะเบียน สำหรับจำกัดตัวอักษร 5,000 ตัว

หมุนข้อความของคุณในแท็ก SSML เพื่อควบคุมอย่างแม่นยำ:

<speak><prosody rate="slow">Slow speech</prosody></speak>

แท็กที่โมเดลที่เลือกไว้เข้าใจ - คลิกเพื่อวางแท็กลงในข้อความของคุณที่มันเกิดขึ้น:

โมเดลนี้อ่านข้อความธรรมดา ดังนั้น แท็กในบรรทัดจะถูกละเลย สำหรับอารมณ์ที่ใช้แท็ก เปลี่ยนไปใช้โมเดลแสดงออก เช่น Orpheus หรือ Bark

ตั้งค่าการออกเสียงที่กำหนดเอง (คำ = การออกเสียง):

-12 +12
0.5x 2.0x
ใช้ฟรีกับไพเปอร์, VITS, MeloTTS
เสียงที่สร้างขึ้นจะปรากฏที่นี่ เลือกโมเดล พิมพ์ข้อความ และคลิกที่ สร้าง
สร้างเสียงสำเร็จแล้ว
0:00
ดาวน์โหลดเพลง ดาวน์โหลด ลิงก์หมดอายุใน 24 ชั่วโมง
ระดับฟรี: ใช้ส่วนตัว ใบอนุญาตเชิงพาณิชย์จาก $5/เดือน
ทำเสียงนี้เป็นเสียงของตัวเอง โคลนเสียงใน 30 วินาที
รัก TTS.ai บอกเพื่อนๆ

เกี่ยวกับ CosyVoice 2

CosyVoice 2, from Alibaba's Tongyi Lab, was designed to make high-quality speech viable in real time. It uses a finite scalar quantization approach combined with flow matching to support streaming synthesis at extremely low latency, while reaching human-comparable naturalness that outperforms many commercial systems in subjective tests. Beyond quality, it offers zero-shot voice cloning from about 3 seconds of audio, cross-lingual synthesis, and fine-grained emotion control. Covering 8 languages with a 1,000-character cap, it's a strong fit for voice assistants, streaming TTS, and other real-time applications.

เหมาะสำหรับ: Real-time applications, streaming TTS, voice assistants

แสดงทั้งหมด CosyVoice 2 เสียง

เพียงแค่มองดู

ผู้พัฒนา
Alibaba (Tongyi Lab)
ใบอนุญาต
Apache 2.0
สัตว์
standard
ความเร็ว
medium
เสียง
ใช่
ภาษา
English, Chinese, Japanese, Korean, French, German, Italian, Spanish
จำนวนตัวอักษรสูงสุด
1000

CosyVoice 2 เสียง

Chinese Female

Chinese
ค่ามาตรฐาน Female

Chinese Male

Chinese
ค่ามาตรฐาน Male

English Female

English
ค่ามาตรฐาน Female

English Male

English
ค่ามาตรฐาน Male

French Female

French
ค่ามาตรฐาน Female

German Female

German
ค่ามาตรฐาน Female

Italian Female

Italian
ค่ามาตรฐาน Female

Japanese Female

Japanese
ค่ามาตรฐาน Female

Korean Female

Korean
ค่ามาตรฐาน Female

Spanish Female

Spanish
ค่ามาตรฐาน Female

CosyVoice 2 คำถามที่พบบ่อย

Yes. CosyVoice 2 uses finite scalar quantization for streaming synthesis at very low latency, which is what makes it suitable for voice assistants and real-time applications.

Yes. It offers zero-shot voice cloning from roughly 3 seconds of reference audio, plus cross-lingual synthesis and emotion control.

Yes. CosyVoice 2 is Apache 2.0 licensed. It supports 8 languages: English, Chinese, Japanese, Korean, French, German, Italian, and Spanish.
← เสียงทั้งหมด