VITS

VITS TTS

The end-to-end TTS architecture that combines a variational autoencoder, normalizing flows, and adversarial training.

Գրանցվել 5000 սանտիմետր սահմանափակում

Ձեր տեքստը SSML տեգերի մեջ տեղադրել ճշգրիտ կառավարման համար.

<speak><prosody rate="slow">Slow speech</prosody></speak>

Ընտրված մոդելի կողմից ընկալվող պիտակներ — սեղմեք դրանք ձեր տեքստում տեղադրելու համար:

Այս մոդելը կարդում է պարզ տեքստը, այնպես որ ներառված տեքստերը անտեսվում են։ Տեքստերի վրա հիմնված էմոցիաների համար փոխեք արտահայտիչ մոդել, ինչպես Orpheus կամ Bark։

Որոշել սեփական արտասանությունը (բառ = արտասանություն):

-12 +12
0.5x 2.0x
Ազատ Piper, VITS, MeloTTS-ով
Այստեղ կհայտնվի ձեր ստեղծած ձայնը։ Ընտրեք մոդել, ներդրեք տեքստ և սեղմեք Ծնվել։
Ավտոմատ ձայնագրում
0:00
Տեղադրել ձայնային Տեղադրել.srt Հղումն ավարտվում է 24 ժամ անց
Ֆրանսիա: Ֆրանսիայի ազգային ռադիո: Ֆրանսիայի ազգային ռադիո. Կազմակերպական լիցենզիա $5/ամս
Սիրում եք TTS.ai-ն? Պատմեք ձեր ընկերներին։

Ընդհանուր VITS

VITS — Variational Inference with adversarial learning for end-to-end Text-to-Speech — was introduced by Jaehyeon Kim and collaborators in 2021 and became a foundational architecture for modern neural speech. Rather than the older two-stage pipeline, it synthesizes audio in a single parallel end-to-end pass, pairing a variational autoencoder with normalizing flows and a GAN-style adversarial training process to lift naturalness. At about 25M parameters and trained on ~585 hours, it produces natural prosody at fast inference speeds and supports multiple speakers. It serves as a solid general-purpose, free baseline and underpins many later models such as Piper and MeloTTS.

Լավագույնը: General-purpose text-to-speech with natural prosody

Ընթերցել բոլորը VITS ձայներ

Հակառակորդի դիրքը

Հեղինակ
Jaehyeon Kim et al.
Լիցենզիա
MIT
Դադար
free
արագություն
fast
Ձայնի կլոնավորում
Ոչ
Լեզուներ
English, German, Spanish, French, Portuguese, Dutch, Finnish, Hungarian, Bulgarian, Japanese, Polish
Օգտագործված ռեժիմ
2000

VITS ձայներ

CSS10 (Dutch)

Dutch
Ազատ Neutral

CSS10 (Finnish)

Finnish
Ազատ Neutral

CSS10 (French)

French
Ազատ Neutral

CSS10 (German)

German
Ազատ Neutral

CSS10 (Hungarian)

Hungarian
Ազատ Neutral

CSS10 (Spanish)

Spanish
Ազատ Neutral

Common Voice (Bulgarian)

Bulgarian
Ազատ Neutral

Common Voice (Portuguese)

Portuguese
Ազատ Neutral

Default

English
Ազատ Neutral

MAI (Polish)

Polish
Ազատ Female

MAI (Ukrainian)

Ukrainian
Ազատ Neutral

VITS TTS - Հաճախ տրվող հարցեր

VITS means Variational Inference with adversarial learning for end-to-end Text-to-Speech. It generates audio in a single parallel pass using a variational autoencoder, normalizing flows, and adversarial (GAN) training, rather than a two-stage pipeline.

Yes. VITS is MIT-licensed and in the free tier, so it can be used commercially.

On TTS.ai, VITS covers 11 languages including English, German, Spanish, French, Portuguese, Dutch, Finnish, Hungarian, Bulgarian, Japanese, and Polish, with multi-speaker support. It does not do voice cloning.
← Բոլոր ձայները