VITS

VITS ສຽງ​ເປັນ​ຂໍ້ຄວາມ

The end-to-end TTS architecture that combines a variational autoencoder, normalizing flows, and adversarial training.

ລົງທະບຽນ ຈໍາກັດ​ຕົວ​ອັກສອນ​ໃຫ້​ໄດ້ 5,000

ວາງ​ຂໍ້ຄວາມ​ຂອງທ່ານ​ໄວ້​ໃນ​ແທັກ SSML ເພື່ອ​ຄວບຄຸມ​ຢ່າງ​ລະອຽດ:

<speak><prosody rate="slow">Slow speech</prosody></speak>

ແທັກ​ທີ່​ຕົວແບບ​ທີ່​ໄດ້​ເລືອກ​ເຂົ້າໃຈ — ກົດ​ເພື່ອ​ປ່ອຍ​ພວກ​ມັນ​ລົງ​ໃນ​ຂໍ້ຄວາມ​ຂອງທ່ານ​ບ່ອນ​ທີ່​ມັນ​ເກີດຂຶ້ນ:

ແບບ​ນີ້​ອ່ານ​ຂໍ້ຄວາມ​ປົກກະຕິ, ສະນັ້ນ​ແທັກ​ໃນ​ແຖບ​ຈະ​ບໍ່​ຖືກ​ລະບຸ​ໄວ້. ສຳ​ລັບ​ຄວາມ​ຮູ້ສຶກ​ທີ່​ອີງ​ໃສ່​ແທັກ, ປ່ຽນ​ໄປ​ຫາ​ແບບ​ທີ່​ສະແດງ​ອອກ​ຄື Orpheus ຫຼື Bark.

ຕັ້ງຄ່າ​ການ​ອອກສຽງ​ແບບ​ສ່ວນ​ຕົວ (ຄໍາ = ການອອກສຽງ):

-12 +12
0.5x 2.0x
ຟຣີ​ກັບ Piper, VITS, MeloTTS
ສຽງ​ທີ່​ໄດ້​ສ້າງ​ຂຶ້ນ​ຂອງ​ທ່ານ​ຈະ​ປາກົດ​ຢູ່​ທີ່​ນີ້. ເລືອກ​ແບບ, ເຂົ້າ​ເຖິງ​ຂໍ້ຄວາມ ແລະ ຄລິກ​ໃສ່ ສ້າງ.
ສ້າງ​ສຽງ​ໄດ້​ຢ່າງ​ສຳເລັດ​ຜົນ
0:00
ດາວໂຫລດ​ສຽງ ດາວໂຫລດ.srt ການ​ເຊື່ອມຕໍ່​ຈະ​ໝົດ​ອາຍຸ​ໃນ 24 ຊົ່ວໂມງ
ລະດັບຟຣີ: ການໃຊ້ສ່ວນຕົວ. ໃບອະນຸຍາດການຄ້າຈາກ $5/ເດືອນ
ກຳລັງໃຊ້​ງານ​ດົນ​ເກີນ​ໄປ​ໃນ​ຕົວອັກສອນ​ທີ່​ມີ ໄດ້ຮັບຕົວອັກສອນ 200K ທຸກໆເດືອນ - $5/ເດືອນ ຫຼື 100K ຄັ້ງດຽວສໍາລັບ $5
ສ້າງສຽງ​ຂອງ​ທ່ານ​ເອງ ສ້າງ​ສຽງ​ແບບ​ຄລາສສິກ​ໃນ​ 30 ວິນາທີ
ຮັກ TTS.ai? ເວົ້າກັບເພື່ອນຂອງທ່ານ!

ກ່ຽວ​ກັບ VITS

VITS — Variational Inference with adversarial learning for end-to-end Text-to-Speech — was introduced by Jaehyeon Kim and collaborators in 2021 and became a foundational architecture for modern neural speech. Rather than the older two-stage pipeline, it synthesizes audio in a single parallel end-to-end pass, pairing a variational autoencoder with normalizing flows and a GAN-style adversarial training process to lift naturalness. At about 25M parameters and trained on ~585 hours, it produces natural prosody at fast inference speeds and supports multiple speakers. It serves as a solid general-purpose, free baseline and underpins many later models such as Piper and MeloTTS.

ດີທີ່ສຸດ ສຳ ລັບ: General-purpose text-to-speech with natural prosody

ຄົ້ນຫາ​ທັງໝົດ VITS ສຽງ

ເບິ່ງ​ຢ່າງ​ໄວວາ

ຜູ້​ພັດທະນາ
Jaehyeon Kim et al.
ໃບອະນຸຍາດ
MIT
ສັດ
free
ໄວ
fast
ການປິດ​ສຽງ
​ບໍ່
ພາສາ
English, German, Spanish, French, Portuguese, Dutch, Finnish, Hungarian, Bulgarian, Japanese, Polish
ຕົວອັກສອນ​ສູງສຸດ
2000

VITS ສຽງ

CSS10 (Dutch)

Dutch
ບໍ່ມີ Neutral

CSS10 (Finnish)

Finnish
ບໍ່ມີ Neutral

CSS10 (French)

French
ບໍ່ມີ Neutral

CSS10 (German)

German
ບໍ່ມີ Neutral

CSS10 (Hungarian)

Hungarian
ບໍ່ມີ Neutral

CSS10 (Spanish)

Spanish
ບໍ່ມີ Neutral

Common Voice (Bulgarian)

Bulgarian
ບໍ່ມີ Neutral

Common Voice (Portuguese)

Portuguese
ບໍ່ມີ Neutral

Default

English
ບໍ່ມີ Neutral

MAI (Polish)

Polish
ບໍ່ມີ Female

MAI (Ukrainian)

Ukrainian
ບໍ່ມີ Neutral

VITS TTS - ຄໍາຖາມ​ທີ່​ຖາມ​ເລື້ອຍໆ

VITS means Variational Inference with adversarial learning for end-to-end Text-to-Speech. It generates audio in a single parallel pass using a variational autoencoder, normalizing flows, and adversarial (GAN) training, rather than a two-stage pipeline.

Yes. VITS is MIT-licensed and in the free tier, so it can be used commercially.

On TTS.ai, VITS covers 11 languages including English, German, Spanish, French, Portuguese, Dutch, Finnish, Hungarian, Bulgarian, Japanese, and Polish, with multi-speaker support. It does not do voice cloning.
← ສຽງ​ທັງ​ໝົດ