Pocket TTS

Pocket TTS TTS

A compact 100M-parameter CPU model from Kyutai (makers of Moshi) with single-sample voice cloning.

Jijjiirama 5,000 character limit

Daangeessii kitaaba keessan keessaa tag SSML akka itti fayyadamtan:

<speak><prosody rate="slow">Slow speech</prosody></speak>

Tag'oota mo'ellaa filatamee beekuu - cuqaasi akka tokkotti galchiin gara teekstaatti yoo ta'e:

Mo'ellaan kun kitaaba salphaa baraa, kan akka taggaa inniin linjii hin beekkamne. Akka taggaa-based emooshiniitti, mo'ellaa akka Orpheus ykn Bark.

Haalli fuula

-12 +12
0.5x 2.0x
Birrii fi Piper, VITS, MeloTTS
Oduu kee kan uumame yooka'u yooka'u. Suuraa moolaa, galchi kitaaba, fi bu'u Jijjiira.
Audion itti fufuu
0:00
Fuula Oduu Fuula Liqii dhumaa 24 sa'a keessatti
Tarree hin-ga'iin: fayyadama namaatiif. Liiziinii Kominikeeshinii irraa $5/mo
TTS.ai jaallatan? Sochii keessanitti hiika!

Fuulaa Pocket TTS

Pocket TTS comes from Kyutai, the lab behind the Moshi speech model, and is built around a transformer paired with the Mimi codec. At just 100M parameters it runs efficiently on CPU, yet it still supports zero-shot voice cloning from a single audio sample — an unusual feature at this size. It covers English and French and handles up to 1,000 characters per request at fast (~2s) speeds. The small footprint and ~1GB VRAM make it a natural fit for edge deployment and low-resource or CPU-only environments where quick voice cloning is needed.

Fakkeenyaaf: Lightweight deployment, CPU-only environments, quick voice cloning

Fuulaa Pocket TTS Dhaamsa

Akkasumas

Deebi'aa
Kyutai
Lizenz
MIT
Daandiin
free
Jijjiiramni
fast
Dhaabbilee
Ya
Afaan Oromoo
English, French
Akkasumas
1000

Pocket TTS Dhaamsa

Alba

English
Birrii Female

Azelma

English
Birrii Female

Cosette

English
Birrii Female

Eponine

English
Birrii Female

Fantine

English
Birrii Female

Fantine (French)

French
Birrii Female

Javert

English
Birrii Male

Jean

English
Birrii Male

Jean (French)

French
Birrii Male

Marius

English
Birrii Male

Pocket TTS TTS — FAQ

Yes. Pocket TTS does zero-shot voice cloning from a single reference sample (about 3 seconds), which is notable for a model this small.

Yes. At 100M parameters it runs efficiently on CPU and needs only about 1GB VRAM if a GPU is used, making it well suited to edge and low-resource deployment.

Yes. Pocket TTS is MIT-licensed and in the free tier. It supports English and French.
← Dhaamsawwan hundaa