VITS

VITS TTS

The end-to-end TTS architecture that combines a variational autoencoder, normalizing flows, and adversarial training.

Skráðu þig inn fyrir 5.000 stafa takmörk

Wrap texta í SSML tags fyrir nákvæma stjórn:

<speak><prosody rate="slow">Slow speech</prosody></speak>

Merki sem valið líkan skilur — smelltu til að sleppa einu í textann þinn þar sem það gerist:

Þetta líkan les venjulegan texta, þannig að innlínumerki eru hunsuð. Fyrir merki sem byggja á tilfinningum, skiptu yfir í tjáningarlíkan eins og Orpheus eða Bark.

Skilgreindu sérsniðna framburð (orð = framburð):

-12 +12
0.5x 2.0x
Frjáls með Piper, VITS, MeloTTS
Hljóðskráin þín birtist hér. Veldu líkan, sláðu inn texta og smelltu á Búa til.
Hljóð búið til
0:00
Sækja hljóð Sækja.srt Tengill rennur út eftir 24 klst
Frjáls tier: persónuleg notkun. Viðskiptaleyfi frá $ 5 / mánuði
Elska TTS.ai? Segðu vinum þínum!

Um VITS

VITS — Variational Inference with adversarial learning for end-to-end Text-to-Speech — was introduced by Jaehyeon Kim and collaborators in 2021 and became a foundational architecture for modern neural speech. Rather than the older two-stage pipeline, it synthesizes audio in a single parallel end-to-end pass, pairing a variational autoencoder with normalizing flows and a GAN-style adversarial training process to lift naturalness. At about 25M parameters and trained on ~585 hours, it produces natural prosody at fast inference speeds and supports multiple speakers. It serves as a solid general-purpose, free baseline and underpins many later models such as Piper and MeloTTS.

Best fyrir: General-purpose text-to-speech with natural prosody

Skoða allt VITS raddir

Í hnotskurn

Forritari
Jaehyeon Kim et al.
Leyfi
MIT
Tími
free
Hraði
fast
Raddklóðun
Nei
Tungumál
English, German, Spanish, French, Portuguese, Dutch, Finnish, Hungarian, Bulgarian, Japanese, Polish
Hámarksstafir
2000

VITS raddir

CSS10 (Dutch)

Dutch
Frjáls Neutral

CSS10 (Finnish)

Finnish
Frjáls Neutral

CSS10 (French)

French
Frjáls Neutral

CSS10 (German)

German
Frjáls Neutral

CSS10 (Hungarian)

Hungarian
Frjáls Neutral

CSS10 (Spanish)

Spanish
Frjáls Neutral

Common Voice (Bulgarian)

Bulgarian
Frjáls Neutral

Common Voice (Portuguese)

Portuguese
Frjáls Neutral

Default

English
Frjáls Neutral

MAI (Polish)

Polish
Frjáls Female

MAI (Ukrainian)

Ukrainian
Frjáls Neutral

VITS TTS — Algengar spurningar

VITS means Variational Inference with adversarial learning for end-to-end Text-to-Speech. It generates audio in a single parallel pass using a variational autoencoder, normalizing flows, and adversarial (GAN) training, rather than a two-stage pipeline.

Yes. VITS is MIT-licensed and in the free tier, so it can be used commercially.

On TTS.ai, VITS covers 11 languages including English, German, Spanish, French, Portuguese, Dutch, Finnish, Hungarian, Bulgarian, Japanese, and Polish, with multi-speaker support. It does not do voice cloning.
← Allar raddir