Spark TTS

Spark TTS TTS

Voice cloning from five seconds of audio combined with prompt-based control over emotion, speed, and speaking style.

ثبت نام برای حد ۵۰۰۰ کاراکتر

برای کنترل دقیق ، متن خود را در برچسبهای SSML بپیچید:

<speak><prosody rate="slow">Slow speech</prosody></speak>

برچسبهایی که مدل برگزیده می‌فهمد — برای انداختن یکی در متن خود ، جایی که اتفاق می‌افتد ، کلیک کنید:

این مدل متن ساده را می‌خواند ، بنابراین برچسب‌های خطی نادیده گرفته می‌شوند. برای احساسات مبتنی بر برچسب ، به یک مدل بیانی مانند Orpheus یا Bark تغییر دهید.

تعریف تلفظ سفارشی) کلمه = تلفظ (:

-12 +12
0.5x 2.0x
آزاد با Piper, VITS, MeloTTS
صدای تولید شده شما در اینجا ظاهر خواهد شد. یک مدل را انتخاب کنید ، متن را وارد کنید ، و تولید را فشار دهید.
صدا با موفقیت تولید شد
0:00
بارگیری صدا دانلود پیوند در ۲۴ ساعت پایان می‌یابد
1- استفاده شخصی: استفاده شخصی. مجوز تجاری از $5/mo
دوست داريد TTS.ai؟ به دوستانتون بگو!

در مورد Spark TTS

Spark TTS by SparkAudio merges voice cloning with controllable delivery in a single prompt-driven system. Using just five seconds of reference audio it clones a voice, then lets you steer emotion, speed, and speaking style while keeping that cloned identity intact. Under the hood it combines a BiCodec audio tokenizer, an LLM, and flow matching, and it supports English and Chinese. It is aimed at content creation where a single cloned voice needs to express a range of moods and pacing. Note the licensing split: Spark's code is Apache 2.0, but the model weights are released under CC BY-NC-SA 4.0, which restricts commercial use.

بهترین برای: Content creation with cloned voices and emotional control

مرور همۀ Spark TTS صداها

يه نگاهي بنداز

توسعه‌دهنده
SparkAudio
مجوز
CC BY-NC-SA 4.0
حیوان
standard
سرعت
medium
شبیه‌سازی صدا
آره
زبانها
English, Chinese
بیشینه نویسه‌ها
1000

Spark TTS صداها

Chinese Default

Chinese
پیش‌فرض Neutral

Default

English
پیش‌فرض Neutral

Spark TTS FAQ - پرسش و پاسخ

It uses a prompt-based control system layered on top of voice cloning, so you can adjust emotion, speed, and speaking style while preserving the identity of the cloned voice.

About five seconds of reference audio is enough to clone a voice in English or Chinese.

Its model weights are licensed CC BY-NC-SA 4.0, which prohibits commercial use, even though the project code is Apache 2.0. Choose a permissively-licensed model for commercial work.
← همه صداها