VITS

VITS ТТС

The end-to-end TTS architecture that combines a variational autoencoder, normalizing flows, and adversarial training.

Жазылу 5000 таңба шегі

Мәтінді SSML тегтермен тасымалдау үшін нұсқау:

<speak><prosody rate="slow">Slow speech</prosody></speak>

Таңдалған үлгі түсінетін тегтер - біреуін мәтінге түсіру үшін түртіңіз:

Бұл модель қарапайым мәтін оқиды, сондықтан жол ішіндегі тегтер елеусіз қалып жатыр. Тегтерге негізделген эмоция үшін Orpheus не Bark сияқты өрнекті модельге ауысыңыз.

Өзінің дыбысын анықтау (сөз = дыбысы):

-12 +12
0.5x 2.0x
Piper, VITS, MeloTTS-пен тегінName
Бұл жерде құрылған аудио файлыңыз көрсетіледі. Үлгіні таңдап, мәтінін келтіріп, Құру дегенді басыңыз.
Аудио сәтті құрылды
0:00
Аудио жүктеп алу .srt жүктеп алу Сілтеменің мерзімі 24 сағаттан кейін аяқталады
Ұлттық құрама: Ұлттық құрама. Коммерциялық лицензия $5/ай-дан
Бұл дауысты өзіңіздің дауысыңыз қылып қойыңыз 30 секундта дауысты көшіріп алу
TTS.ai ұнады ма? Достарыңызға хабарлаңыз!

& Бұл туралы VITS

VITS — Variational Inference with adversarial learning for end-to-end Text-to-Speech — was introduced by Jaehyeon Kim and collaborators in 2021 and became a foundational architecture for modern neural speech. Rather than the older two-stage pipeline, it synthesizes audio in a single parallel end-to-end pass, pairing a variational autoencoder with normalizing flows and a GAN-style adversarial training process to lift naturalness. At about 25M parameters and trained on ~585 hours, it produces natural prosody at fast inference speeds and supports multiple speakers. It serves as a solid general-purpose, free baseline and underpins many later models such as Piper and MeloTTS.

Келесіге ең қолайлы: General-purpose text-to-speech with natural prosody

Барлығын қарау VITS дауыс

Бір қарапайым

Жасаушы
Jaehyeon Kim et al.
Лицензия
MIT
Түр
free
Жылдамдығы
fast
Дыбысын көшіру
Жоқ
Тілдер
English, German, Spanish, French, Portuguese, Dutch, Finnish, Hungarian, Bulgarian, Japanese, Polish
Макс. таңбалар саны
2000

VITS дауыс

CSS10 (Dutch)

Dutch
Бос Neutral

CSS10 (Finnish)

Finnish
Бос Neutral

CSS10 (French)

French
Бос Neutral

CSS10 (German)

German
Бос Neutral

CSS10 (Hungarian)

Hungarian
Бос Neutral

CSS10 (Spanish)

Spanish
Бос Neutral

Common Voice (Bulgarian)

Bulgarian
Бос Neutral

Common Voice (Portuguese)

Portuguese
Бос Neutral

Default

English
Бос Neutral

MAI (Polish)

Polish
Бос Female

MAI (Ukrainian)

Ukrainian
Бос Neutral

VITS ТТС - ЖАҚСЫ СҰРАҚТАР

VITS means Variational Inference with adversarial learning for end-to-end Text-to-Speech. It generates audio in a single parallel pass using a variational autoencoder, normalizing flows, and adversarial (GAN) training, rather than a two-stage pipeline.

Yes. VITS is MIT-licensed and in the free tier, so it can be used commercially.

On TTS.ai, VITS covers 11 languages including English, German, Spanish, French, Portuguese, Dutch, Finnish, Hungarian, Bulgarian, Japanese, and Polish, with multi-speaker support. It does not do voice cloning.
← Барлық дауыстар