Pocket TTS

Pocket TTS TTS

A compact 100M-parameter CPU model from Kyutai (makers of Moshi) with single-sample voice cloning.

Akaụntụ maka 5,000 akara oghe

Kpọchie ngwe gị n'ime SSML táàbụ̀ maka nlekọta ziri ezi:

<speak><prosody rate="slow">Slow speech</prosody></speak>

Táàbụ̀ nke móòdù ahụ a họọrọ na-aghọta - pịa ka ịkpụga otu n'ime ngwe gị ebe ọ na-eme:

Móòdù a na-agụ ngwe nkịtị, yabụ na a na-ewepụta inline táàbụ̀. Maka táàbụ̀-n'okpuru n'émóòdù, gbanwee ka móòdù na-egosi ihe dịka Orpheus mọọbụ Bark.

Ndesịta okwu emeredịkachọrọ:

-12 +12
0.5x 2.0x
Free na Piper, VITS, MeloTTS
Ọdịdị gị ga-egosipụta ebe a. Họrọ móòdù, tinye ngwe, ma pịa Kewapụta.
Ọdịdị a mepụtala nke ọma
0:00
Bubata ụda Bubata.srt Ndesịta njikọ ahụ ga-agwụ n'ime 24h
Free tier: ojiji onwe onye. Commercial license site na $5/mo
Mee ka ọ bụrụ ụda gị Kloo ụda n'ime sekọnd 30
Ị hụrụ TTS.ai? Kpọtụrụ enyi gị!

_N'ihe banyere Pocket TTS

Pocket TTS comes from Kyutai, the lab behind the Moshi speech model, and is built around a transformer paired with the Mimi codec. At just 100M parameters it runs efficiently on CPU, yet it still supports zero-shot voice cloning from a single audio sample — an unusual feature at this size. It covers English and French and handles up to 1,000 characters per request at fast (~2s) speeds. The small footprint and ~1GB VRAM make it a natural fit for edge deployment and low-resource or CPU-only environments where quick voice cloning is needed.

Ọkachasị maka: Lightweight deployment, CPU-only environments, quick voice cloning

Nlegharịa niile Pocket TTS ụda

N'ime nlele

Ńkwádò
Kyutai
Ikikere
CC BY 4.0 (weights)
Tier
free
Nhazi
fast
Nhazi ụda
Ee
Asụsụ ndị ahụ
English, French
Ụhara Max
1000

Pocket TTS ụda

Alba

English
Free Female

Azelma

English
Free Female

Cosette

English
Free Female Oge ọrụ nkeonwe na nke na-abụghị nke azụmahịa

Eponine

English
Free Female

Fantine

English
Free Female

Fantine (French)

French
Free Female

Javert

English
Free Male

Jean

English
Free Male Oge ọrụ nkeonwe na nke na-abụghị nke azụmahịa

Jean (French)

French
Free Male Oge ọrụ nkeonwe na nke na-abụghị nke azụmahịa

Marius

English
Free Male

Pocket TTS TTS - Ajụjụ ndị na-emekarị

Yes. Pocket TTS does zero-shot voice cloning from a single reference sample (about 3 seconds), which is notable for a model this small.

Yes. At 100M parameters it runs efficiently on CPU and needs only about 1GB VRAM if a GPU is used, making it well suited to edge and low-resource deployment.

Mostly. Pocket TTS weights are released under CC BY 4.0 and it sits in the free tier. Its Jean and Cosette voices come from non-commercial datasets and are marked "Personal and non-commercial use only" on every plan. Audio from its other voices is for personal use on the free tier and can be used commercially on any paid plan. It supports English and French.
← Agụgụala niile