Pocket TTS

Pocket TTS ТТС

A compact 100M-parameter CPU model from Kyutai (makers of Moshi) with single-sample voice cloning.

Падпісацца Абмежаванне на 5000 знакаў

Захоўваць тэкст у тэгах SSML для дакладнага кантролю:

<speak><prosody rate="slow">Slow speech</prosody></speak>

Тэгі, якія разумее выбраная мадэль - націсніце, каб перанесці іх у тэкст:

Гэтая мадэль чытае звычайны тэкст, таму ўбудаваныя тэгі ігнаруюцца. Для эмоцый, заснаваных на тэгах, пераключыцеся на мадэлі выразнасці, такія як Orpheus або Bark.

Вызначыць уласнае вымаўленне (слова = вымаўленне):

-12 +12
0.5x 2.0x
Свабодны з Piper, VITS, MeloTTS
Створаны вамі гук з' явіцца тут. Выберыце мадэль, увядзіце тэкст і націсніце Стварыць.
Аўдыё паспяхова створанаName
0:00
Сцягнуць гук Сцягнуць.srt Тэрмін дзеяння спасылкі скончыцца праз 24 гадзіны
Любіце TTS.ai? Раскажыце сваім сябрам!

Пра Pocket TTS

Pocket TTS comes from Kyutai, the lab behind the Moshi speech model, and is built around a transformer paired with the Mimi codec. At just 100M parameters it runs efficiently on CPU, yet it still supports zero-shot voice cloning from a single audio sample — an unusual feature at this size. It covers English and French and handles up to 1,000 characters per request at fast (~2s) speeds. The small footprint and ~1GB VRAM make it a natural fit for edge deployment and low-resource or CPU-only environments where quick voice cloning is needed.

Лепшы для: Lightweight deployment, CPU-only environments, quick voice cloning

Прагляд усіх Pocket TTS галасы

Кароткае апісанне

Распрацоўшчык
Kyutai
Ліцэнзія
MIT
Стварыць
free
Хуткасць
fast
Клонаванне голасу
Так
Мовы
English, French
Найбольшая колькасць знакаў
1000

Pocket TTS галасы

Alba

English
Свабодны Female

Azelma

English
Свабодны Female

Cosette

English
Свабодны Female

Eponine

English
Свабодны Female

Fantine

English
Свабодны Female

Fantine (French)

French
Свабодны Female

Javert

English
Свабодны Male

Jean

English
Свабодны Male

Jean (French)

French
Свабодны Male

Marius

English
Свабодны Male

Pocket TTS Частыя пытанні

Yes. Pocket TTS does zero-shot voice cloning from a single reference sample (about 3 seconds), which is notable for a model this small.

Yes. At 100M parameters it runs efficiently on CPU and needs only about 1GB VRAM if a GPU is used, making it well suited to edge and low-resource deployment.

Yes. Pocket TTS is MIT-licensed and in the free tier. It supports English and French.
← Усе галасы