Pocket TTS

Pocket TTS TTS

A compact 100M-parameter CPU model from Kyutai (makers of Moshi) with single-sample voice cloning.

Zaregistrovat se pro 5000 znaků limit

Zabalte svůj text do značek SSML pro přesné ovládání:

<speak><prosody rate="slow">Slow speech</prosody></speak>

Značky vybraného modelu rozumí? klikněte na tlačítko pro kapku jednoho do textu, kde se to stane:

Tento model čte prostý text, takže inline značky jsou ignorovány. Pro tag-based emotion, přepněte na expresivní model, jako je Orpheus nebo Bark.

Definovat vlastní výslovnosti (slovo = výslovnost):

-12 +12
0.5x 2.0x
Zdarma s Piper, VITS, MeloTTS
Zde se objeví váš vygenerovaný zvuk. Vyberte model, zadejte text a klikněte na Generovat.
Audio generované úspěšně
0:00
Stáhnout zvuk Stáhnout.srt Odkaz vyprší v 24 hodin
Volný stupeň: osobní použití. Obchodní licence od 5 dolarů/mo
Miluju TTS.ai? Řekni to svým přátelům!

O aplikaci Pocket TTS

Pocket TTS comes from Kyutai, the lab behind the Moshi speech model, and is built around a transformer paired with the Mimi codec. At just 100M parameters it runs efficiently on CPU, yet it still supports zero-shot voice cloning from a single audio sample — an unusual feature at this size. It covers English and French and handles up to 1,000 characters per request at fast (~2s) speeds. The small footprint and ~1GB VRAM make it a natural fit for edge deployment and low-resource or CPU-only environments where quick voice cloning is needed.

Nejlepší pro: Lightweight deployment, CPU-only environments, quick voice cloning

Procházet vše Pocket TTS hlasy

Na první pohled

Vývojář
Kyutai
Licence
MIT
Úroveň
free
Rychlost
fast
Klonování hlasu
Ano.
Jazyky
English, French
Max znaků
1000

Pocket TTS hlasy

Alba

English
Volné Female

Azelma

English
Volné Female

Cosette

English
Volné Female

Eponine

English
Volné Female

Fantine

English
Volné Female

Fantine (French)

French
Volné Female

Javert

English
Volné Male

Jean

English
Volné Male

Jean (French)

French
Volné Male

Marius

English
Volné Male

Pocket TTS FAQ TTS

Yes. Pocket TTS does zero-shot voice cloning from a single reference sample (about 3 seconds), which is notable for a model this small.

Yes. At 100M parameters it runs efficiently on CPU and needs only about 1GB VRAM if a GPU is used, making it well suited to edge and low-resource deployment.

Yes. Pocket TTS is MIT-licensed and in the free tier. It supports English and French.
← Všechny hlasy