Pocket TTS

Pocket TTS TTS

A compact 100M-parameter CPU model from Kyutai (makers of Moshi) with single-sample voice cloning.

Tilmeld dig for 5.000 tegngrænse

Wrap din tekst i SSML tags for præcis kontrol:

<speak><prosody rate="slow">Slow speech</prosody></speak>

Tags den valgte model forstår! klik for at droppe en i din tekst, hvor det sker:

Denne model læser almindelig tekst, så inline tags ignoreres. For tag-baserede følelser, skifte til en ekspressiv model som Orpheus eller Bark.

Definer brugerdefinerede udtaler (ord = udtale):

-12 +12
0.5x 2.0x
Gratis med Piper, VITS, MeloTTS
Din genererede lyd vises her. Vælg en model, indtast tekst, og klik på Generér.
Lydgenereret med succes
0:00
Download lyd Download.srt Link udløber i 24 timer
Gratis niveau: personlig brug. Handelslicens fra $5/mo
Elsker TTS.ai? Fortæl dine venner!

Om Pocket TTS

Pocket TTS comes from Kyutai, the lab behind the Moshi speech model, and is built around a transformer paired with the Mimi codec. At just 100M parameters it runs efficiently on CPU, yet it still supports zero-shot voice cloning from a single audio sample — an unusual feature at this size. It covers English and French and handles up to 1,000 characters per request at fast (~2s) speeds. The small footprint and ~1GB VRAM make it a natural fit for edge deployment and low-resource or CPU-only environments where quick voice cloning is needed.

Bedst for: Lightweight deployment, CPU-only environments, quick voice cloning

Gennemse alle Pocket TTS stemmer

Et blik

Udvikler
Kyutai
Licens
MIT
Metodetrin
free
Hastighed
fast
Stemmekloning
Ja
Sprog
English, French
Maks. tegn
1000

Pocket TTS stemmer

Alba

English
Fri Female

Azelma

English
Fri Female

Cosette

English
Fri Female

Eponine

English
Fri Female

Fantine

English
Fri Female

Fantine (French)

French
Fri Female

Javert

English
Fri Male

Jean

English
Fri Male

Jean (French)

French
Fri Male

Marius

English
Fri Male

Pocket TTS Ofte stillede spørgsmål om TTS

Yes. Pocket TTS does zero-shot voice cloning from a single reference sample (about 3 seconds), which is notable for a model this small.

Yes. At 100M parameters it runs efficiently on CPU and needs only about 1GB VRAM if a GPU is used, making it well suited to edge and low-resource deployment.

Yes. Pocket TTS is MIT-licensed and in the free tier. It supports English and French.
← Alle stemmer