VITS

VITS TTS

The end-to-end TTS architecture that combines a variational autoencoder, normalizing flows, and adversarial training.

Pierakstīties 5000 rakstzīmju limitam

Aplauzt savu tekstu SSML tagus precīzai kontrolei:

<speak><prosody rate="slow">Slow speech</prosody></speak>

Tags izvēlētais modelis saprot — noklikšķiniet, lai iemestu vienu jūsu tekstā, kur tas notiek:

Šis modelis lasa vienkāršu tekstu, tāpēc tiek ignorēti inline tagi. Uz tag-based emocijas, pāriet uz izteiksmīgu modeli, piemēram, Orpheus vai Bark.

Definēt pielāgotu izrunas (vārds = izruna):

-12 +12
0.5x 2.0x
Bez piper, VITS, MeloTTS
Šeit parādīsies jūsu ģenerētais audio. Izvēlieties modeli, ievadiet tekstu un noklikšķiniet ģenerējiet.
Audio veiksmīgi ģenerēts
0:00
Lejupielādēt audio Lejupielādēt.srt Saite beidzas 24h
Bezmaksas līmenis: personīgai lietošanai. Komerclicenci no $5/mo
Mīlestība TTS.ai? Stāsti saviem draugiem!

Par VITS

VITS — Variational Inference with adversarial learning for end-to-end Text-to-Speech — was introduced by Jaehyeon Kim and collaborators in 2021 and became a foundational architecture for modern neural speech. Rather than the older two-stage pipeline, it synthesizes audio in a single parallel end-to-end pass, pairing a variational autoencoder with normalizing flows and a GAN-style adversarial training process to lift naturalness. At about 25M parameters and trained on ~585 hours, it produces natural prosody at fast inference speeds and supports multiple speakers. It serves as a solid general-purpose, free baseline and underpins many later models such as Piper and MeloTTS.

Labākais: General-purpose text-to-speech with natural prosody

Pārlūkot visu VITS balsis

Īsumā

Izstrādātājs
Jaehyeon Kim et al.
Licence
MIT
Līmeņrādis
free
Ātrums
fast
Balss klonēšana
Valodas
English, German, Spanish, French, Portuguese, Dutch, Finnish, Hungarian, Bulgarian, Japanese, Polish
Maks. rakstzīmes
2000

VITS balsis

CSS10 (Dutch)

Dutch
Bezmaksas Neutral

CSS10 (Finnish)

Finnish
Bezmaksas Neutral

CSS10 (French)

French
Bezmaksas Neutral

CSS10 (German)

German
Bezmaksas Neutral

CSS10 (Hungarian)

Hungarian
Bezmaksas Neutral

CSS10 (Spanish)

Spanish
Bezmaksas Neutral

Common Voice (Bulgarian)

Bulgarian
Bezmaksas Neutral

Common Voice (Portuguese)

Portuguese
Bezmaksas Neutral

Default

English
Bezmaksas Neutral

MAI (Polish)

Polish
Bezmaksas Female

MAI (Ukrainian)

Ukrainian
Bezmaksas Neutral

VITS TTS – FAQ

VITS means Variational Inference with adversarial learning for end-to-end Text-to-Speech. It generates audio in a single parallel pass using a variational autoencoder, normalizing flows, and adversarial (GAN) training, rather than a two-stage pipeline.

Yes. VITS is MIT-licensed and in the free tier, so it can be used commercially.

On TTS.ai, VITS covers 11 languages including English, German, Spanish, French, Portuguese, Dutch, Finnish, Hungarian, Bulgarian, Japanese, and Polish, with multi-speaker support. It does not do voice cloning.
← Visas balsis