Spark TTS

Spark TTS ТТС

Voice cloning from five seconds of audio combined with prompt-based control over emotion, speed, and speaking style.

Ёзиш 5000 белги чегараси

Матнни аниқ назорат учун SSML теглар билан ўраб қўйиш:

<speak><prosody rate="slow">Slow speech</prosody></speak>

Танланган модел тушунадиган тегилар — уларни матнга тушириш учун босинг:

Бу модел оддий матн ўқийди, шунинг учун тегишли теги эътиборга олинмайди. Эмоционал теги асосида, Orpheus ёки Bark каби ифодали моделга ўтинг.

Ўз нутқини белгилаш (сўз = нутқ):

-12 +12
0.5x 2.0x
Piper, VITS, MeloTTS билан бепул
Сизнинг яратилган аудионгиз бу ерда намоён бўлади. Модельни танланг, матнни киритинг ва Юклаш тугмасини босинг.
Аудио муваффақиятли яратилди
0:00
Аудио юклаб олиш .srt юклаб олиш Уланиш муддати 24 соатдан сўнг тугайди
Бепул даража: шахсий фойдаланиш. $5/mo дан бошланувчи коммерциявий лицензия
Буни ўз овозингизга айлантиринг 30 сония ичида овозни клонлаш
TTS.ai'ни севасанми? Дўстларингга айт!

Маълумот Spark TTS

Spark TTS by SparkAudio merges voice cloning with controllable delivery in a single prompt-driven system. Using just five seconds of reference audio it clones a voice, then lets you steer emotion, speed, and speaking style while keeping that cloned identity intact. Under the hood it combines a BiCodec audio tokenizer, an LLM, and flow matching, and it supports English and Chinese. It is aimed at content creation where a single cloned voice needs to express a range of moods and pacing. Note the licensing split: Spark's code is Apache 2.0, but the model weights are released under CC BY-NC-SA 4.0, which restricts commercial use.

Энг яхшиси: Content creation with cloned voices and emotional control

Ҳаммасини кўриш Spark TTS овозлар

Бир қарашда

Ижодкор
SparkAudio
Лицензия
CC BY-NC-SA 4.0
Тир
standard
Тезлик
medium
Овозни клонлаш
Ҳа
Тиллар
English, Chinese
Максимум ҳарфлар
1000

Spark TTS овозлар

Chinese Default

Chinese
Стандарт Neutral

Default

English
Стандарт Neutral

Spark TTS ТТС — кўп бериладиган саволлар

It uses a prompt-based control system layered on top of voice cloning, so you can adjust emotion, speed, and speaking style while preserving the identity of the cloned voice.

About five seconds of reference audio is enough to clone a voice in English or Chinese.

Its model weights are licensed CC BY-NC-SA 4.0, which prohibits commercial use, even though the project code is Apache 2.0. Choose a permissively-licensed model for commercial work.
← Барча овозлар