VITS

VITS ТТС

The end-to-end TTS architecture that combines a variational autoencoder, normalizing flows, and adversarial training.

Бақайдгирӣ барои 5000 аломат маҳдудият

Матнро дар SSML тегҳо барои идоракунии дақиқ гузоред:

<speak><prosody rate="slow">Slow speech</prosody></speak>

Барчаспҳо, ки аз тарафи намунаи интихобшуда фаҳмида мешаванд - барои гузоштани яке аз онҳо дар матни худ, ки дар он ҷо рӯй медиҳад, пахш кунед:

Ин намуна матни оддиро мехонад, аз ин рӯ, нишонаҳои дар сатр бударо нодида мегиранд. Барои нишонаҳои асосӣ ба намунаи ифодакунандаи Orpheus ё Bark гузаред.

Муайян кардани талаффузи оддӣ (калима = талаффуз):

-12 +12
0.5x 2.0x
Озод бо Piper, VITS, MeloTTS
Дар ин ҷо садои эҷодшудаи шумо пайдо мешавад. Намунаро интихоб кунед, матнро ворид кунед ва пахш кунед Эҷод кунед.
Аудио бо муваффақият эҷод шуд
0:00
Боргирии аудио Боргирӣ Мӯҳлати пайванд баъди 24 соат ба итмом мерасад
Шаблон:Шаҳристон Лицензияи тиҷоратӣ аз $5/мо
Ин овозро овози худ созед Нусхаи овоз дар 30 сония
Шумо TTS.ai-ро дӯст медоред? Ба дӯстонатон бигӯед!

Дар бораи VITS

VITS — Variational Inference with adversarial learning for end-to-end Text-to-Speech — was introduced by Jaehyeon Kim and collaborators in 2021 and became a foundational architecture for modern neural speech. Rather than the older two-stage pipeline, it synthesizes audio in a single parallel end-to-end pass, pairing a variational autoencoder with normalizing flows and a GAN-style adversarial training process to lift naturalness. At about 25M parameters and trained on ~585 hours, it produces natural prosody at fast inference speeds and supports multiple speakers. It serves as a solid general-purpose, free baseline and underpins many later models such as Piper and MeloTTS.

Беҳтарин барои: General-purpose text-to-speech with natural prosody

Баррасии ҳама VITS овозҳо

Дар як назар

Тайёркунанда
Jaehyeon Kim et al.
Иҷозатнома
MIT
& Тағйиротҳо
free
Суръат
fast
Тасвири овоз
& Намоиши хатҳои равон
Забонҳо
English, German, Spanish, French, Portuguese, Dutch, Finnish, Hungarian, Bulgarian, Japanese, Polish
Аломатҳои зиёд
2000

VITS овозҳо

CSS10 (Dutch)

Dutch
Озод Neutral

CSS10 (Finnish)

Finnish
Озод Neutral

CSS10 (French)

French
Озод Neutral

CSS10 (German)

German
Озод Neutral

CSS10 (Hungarian)

Hungarian
Озод Neutral

CSS10 (Spanish)

Spanish
Озод Neutral

Common Voice (Bulgarian)

Bulgarian
Озод Neutral

Common Voice (Portuguese)

Portuguese
Озод Neutral

Default

English
Озод Neutral

MAI (Polish)

Polish
Озод Female

MAI (Ukrainian)

Ukrainian
Озод Neutral

VITS Саволҳои зиёд

VITS means Variational Inference with adversarial learning for end-to-end Text-to-Speech. It generates audio in a single parallel pass using a variational autoencoder, normalizing flows, and adversarial (GAN) training, rather than a two-stage pipeline.

Yes. VITS is MIT-licensed and in the free tier, so it can be used commercially.

On TTS.ai, VITS covers 11 languages including English, German, Spanish, French, Portuguese, Dutch, Finnish, Hungarian, Bulgarian, Japanese, and Polish, with multi-speaker support. It does not do voice cloning.
← Ҳамаи овозҳо