Pocket TTS

Pocket TTS TTS

A compact 100M-parameter CPU model from Kyutai (makers of Moshi) with single-sample voice cloning.

قوشۇل 5000 ھەرپ چەكلىمىسى

توغرا كونترول قىلىش ئۈچۈن تېكىستنى SSML تېگلىرى ئىچىگە ئايلاندۇرۇش:

<speak><prosody rate="slow">Slow speech</prosody></speak>

تاللانغان مودېل چۈشىنىدىغان تېگلەر - بىرىنى تېكىستىڭىزگە چۈشۈرۈش ئۈچۈن چېكىڭ:

بۇ مودىل ئاددىي تېكىستنى ئوقۇيدۇ، شۇڭا سۈرەتتە بار چەكلىمىلەر قوبۇل قىلىنمايدۇ. چەكلىمىلەرگە ئاساسەن ھېسسىياتنى ئىپادىلەش ئۈچۈن Orpheus ياكى Bark دەك ئىپادىلەش مودىلىغا ئۆزگەرتىشكە بولىدۇ.

خالىغان ئىپادىلەشنى بەلگىلەش (سۆز = ئىپادىلەش):

-12 +12
0.5x 2.0x
Piper، VITS، MeloTTS بىلەن ھەقسىز
سىز ياسىغان ئاۋاز بۇ يەردە كۆرۈنىدۇ. بىر تۈرنى تاللاپ، تېكىستنى كىرگۈزۈپ، ياسىغىن نى چېكىڭ.
ئاۋاز مۇۋەپپەقىيەتلىك ياسالدى
0:00
ئاۋازنى چۈشۈرۈش .srt چۈشۈرۈش سەۋەب 24 سائەت ئىچىدە ئۆتىدۇ
TTS.ai نى ياخشى كۆرەمسىز؟ دوستلىرىڭىزغا ئېيتىپ بېرىڭلار!

توغرىسىدا Pocket TTS

Pocket TTS comes from Kyutai, the lab behind the Moshi speech model, and is built around a transformer paired with the Mimi codec. At just 100M parameters it runs efficiently on CPU, yet it still supports zero-shot voice cloning from a single audio sample — an unusual feature at this size. It covers English and French and handles up to 1,000 characters per request at fast (~2s) speeds. The small footprint and ~1GB VRAM make it a natural fit for edge deployment and low-resource or CPU-only environments where quick voice cloning is needed.

ئەڭ ياخشىسى: Lightweight deployment, CPU-only environments, quick voice cloning

ھەممىنى كۆرۈش Pocket TTS ئاۋازلار

بىر كۆزىتىش

ئىجادىيەتچى
Kyutai
ئىجازەتنامە
MIT
ھايۋان
free
تېزلىك
fast
ئاۋازنى كۆچۈرۈش
ھەئە
تىللار
English, French
ئەڭ كۆپ ھەرپ
1000

Pocket TTS ئاۋازلار

Alba

English
بوش Female

Azelma

English
بوش Female

Cosette

English
بوش Female

Eponine

English
بوش Female

Fantine

English
بوش Female

Fantine (French)

French
بوش Female

Javert

English
بوش Male

Jean

English
بوش Male

Jean (French)

French
بوش Male

Marius

English
بوش Male

Pocket TTS TTS - كۆپ سورالغان سوئاللار

Yes. Pocket TTS does zero-shot voice cloning from a single reference sample (about 3 seconds), which is notable for a model this small.

Yes. At 100M parameters it runs efficiently on CPU and needs only about 1GB VRAM if a GPU is used, making it well suited to edge and low-resource deployment.

Yes. Pocket TTS is MIT-licensed and in the free tier. It supports English and French.
← ھەممىسى ئاۋاز