VoxCPM

VoxCPM TTS

A tokenizer-free TTS model that works in continuous space, outputs 44.1kHz audio, and stays consistent across paragraphs.

Regisztrálj! 5000 karakterhatárra

Írja be a szöveget az SSML címkékbe a pontos vezérlés érdekében:

<speak><prosody rate="slow">Slow speech</prosody></speak>

A kijelölt modell tagjeiben a ~ kattintson az alábbi szövegbe:

Ez a modell egyszerű szöveget olvas, így a sorcímke figyelmen kívül marad. A tag alapú érzelem, váltson át egy expresszív modell, mint Orpheus vagy Bark.

Definiáld az egyéni kiejtéseket (szó = kiejtés):

-12 +12
0.5x 2.0x
Szabad Piper, VITS, MelotTS
A generált audio jelenik meg itt. Válasszon ki egy modellt, írja be a szöveget, és kattintson a Generate gombra.
Audio generált sikeresen
0:00
Audio letöltése Letöltés.srt A kapcsolat 24 órán belül lejár
Ingyenes szint: személyes használat. Kereskedelmi engedély 5 dollárról
Mondd el a barátaidnak!

About VoxCPM

VoxCPM 1.5 by OpenBMB takes an unusual approach: instead of converting speech into discrete tokens, it operates directly in continuous space, which helps it preserve fine acoustic detail. It produces high-fidelity 44.1kHz audio, supports zero-shot voice cloning from three to ten seconds of reference, and maintains a consistent voice across long passages — a common failure point for other models on multi-paragraph text. Its cross-language cloning lets an English reference voice speak Chinese and vice versa. With Apache 2.0 licensing and LoRA fine-tuning support, it is well suited to audiobooks and long-form content where voice consistency over many paragraphs is essential.

Legjobb: High-fidelity audio, audiobooks, long-form content with voice consistency

Összes böngészés VoxCPM hangok

Egy pillantásra

Fejlesztő
OpenBMB
Jogosítvány
Apache 2.0
Tier
standard
Sebesség
fast
Hang klónozása
Igen.
Nyelvek
English, Chinese
Max. karakterek
2000

VoxCPM hangok

Default

English
Szabvány Neutral

Default Chinese

Chinese
Szabvány Neutral

VoxCPM TTS - FAQCharselect unicode block name (optional, probably does not need a translation)

Rather than discretizing speech into tokens, VoxCPM models audio in continuous space using flow matching. This helps it retain subtle acoustic detail and produce clean 44.1kHz output.

Yes. It is specifically designed to keep the voice consistent across paragraphs, which makes it well suited to audiobooks and other long passages where other models tend to drift.

Yes. It supports cross-lingual cloning between English and Chinese — for example applying an English reference voice to Chinese speech — from three to ten seconds of audio.
← Minden hang