Pocket TTS

Pocket TTS TTS

A compact 100M-parameter CPU model from Kyutai (makers of Moshi) with single-sample voice cloning.

Prijavite se za ograničenje od 5.000 znakova

Omotajte tekst u SSML oznake za preciznu kontrolu:

<speak><prosody rate="slow">Slow speech</prosody></speak>

Oznake koje odabrani model razumije — kliknite da biste ih ubacili u tekst gdje se pojavljuju:

Ovaj model čita običan tekst, tako da se inline oznake ignoriraju. Za emocije zasnovane na oznakama, prebacite se na ekspresivni model poput Orpheusa ili Bark-a.

Definirajte vlastite izgovore (riječ = izgovor):

-12 +12
0.5x 2.0x
Besplatno sa Piper, VITS, MeloTTS
Ovdje će se pojaviti vaš generirani audio. Izaberite model, unesite tekst i kliknite na Generiraj.
Audio uspješno generisan
0:00
Preuzmi audio Preuzmi.srt Link istječe za 24h
Free tier: personal use. Komercijalna licenca od $5/mjesečno
Volite TTS.ai?

O meni Pocket TTS

Pocket TTS comes from Kyutai, the lab behind the Moshi speech model, and is built around a transformer paired with the Mimi codec. At just 100M parameters it runs efficiently on CPU, yet it still supports zero-shot voice cloning from a single audio sample — an unusual feature at this size. It covers English and French and handles up to 1,000 characters per request at fast (~2s) speeds. The small footprint and ~1GB VRAM make it a natural fit for edge deployment and low-resource or CPU-only environments where quick voice cloning is needed.

Najbolje za: Lightweight deployment, CPU-only environments, quick voice cloning

Pregledaj sve Pocket TTS glasovi

Na prvi pogled

Programer
Kyutai
Licenca
MIT
Životinje
free
Brzina
fast
Kloniranje glasa
Da.
Jezici
English, French
Maksimalan broj znakova
1000

Pocket TTS glasovi

Alba

English
Slobodan Female

Azelma

English
Slobodan Female

Cosette

English
Slobodan Female

Eponine

English
Slobodan Female

Fantine

English
Slobodan Female

Fantine (French)

French
Slobodan Female

Javert

English
Slobodan Male

Jean

English
Slobodan Male

Jean (French)

French
Slobodan Male

Marius

English
Slobodan Male

Pocket TTS FAQ

Yes. Pocket TTS does zero-shot voice cloning from a single reference sample (about 3 seconds), which is notable for a model this small.

Yes. At 100M parameters it runs efficiently on CPU and needs only about 1GB VRAM if a GPU is used, making it well suited to edge and low-resource deployment.

Yes. Pocket TTS is MIT-licensed and in the free tier. It supports English and French.
← Svi glasovi