VibeVoice

VibeVoice TTS

Microsoft's multi-speaker long-form model that generates up to 90 minutes with 4 distinct speakers.

Inscrivez-vous pour la limite de 5 000 caractères

Enveloppez votre texte dans des balises SSML pour un contrôle précis :

<speak><prosody rate="slow">Slow speech</prosody></speak>

Mots clés le modèle sélectionné comprend — cliquez pour en déposer un dans votre texte où il se produit:

Ce modèle lit du texte clair, donc les balises en ligne sont ignorées. Pour l'émotion basée sur les tags, passer à un modèle expressif comme Orphée ou Bark.

Définir les prononciations personnalisées (mot = prononciation) :

-12 +12
0.5x 2.0x
Gratuit avec Piper, VITS, MeloTTS
Votre audio généré apparaîtra ici. Choisissez un modèle, entrez le texte et cliquez sur Générer.
Production audio réussie
0:00
Télécharger l'audio Télécharger.srt Lien expire en 24h
Niveau gratuit: usage personnel. Licence commerciale à partir de 5 $/mois
Vous aimez TTS.ai ? Parlez-en à vos amis !

À propos VibeVoice

VibeVoice from Microsoft is built for long-form, multi-speaker audio. Its 1.5B model can generate up to 90 minutes of speech with as many as 4 simultaneous speakers, using speaker tags to drive multi-turn dialogue — a strong fit for podcasts, audiobooks, and conversations that need speaker consistency across long passages. A separate Realtime 0.5B variant reaches roughly 300ms latency for interactive use. On TTS.ai it covers English and Chinese and accepts up to 50,000 characters per request, so an entire episode can be scripted in one pass.

Meilleur pour: Podcasts, dialogues, long-form narration, multi-speaker content

Tout voir VibeVoice voix

En un coup d'oeil

Développeur
Microsoft
Licence
MIT
Niveau
standard
Régime
fast
Closonnage de la voix
Numéro
Langues
English, Chinese
Personnages maxi
50000

VibeVoice voix

Speaker 1

English
Norme Neutral

Speaker 1 (Chinese)

Chinese
Norme Neutral

Speaker 2

English
Norme Neutral

Speaker 2 (Chinese)

Chinese
Norme Neutral

Speaker 3

English
Norme Neutral

Speaker 4

English
Norme Neutral

VibeVoice TTS — FAQ

VibeVoice supports up to 4 distinct speakers and up to 90 minutes of continuous output, with speaker tags for multi-turn dialogue — built for podcasts and long-form narration. It accepts up to 50,000 characters per request.

Yes. Alongside the 1.5B long-form model, a Realtime 0.5B variant achieves roughly 300ms latency for interactive use.

VibeVoice is MIT-licensed. It supports English and Chinese and does not currently support voice cloning.
← Toutes les voix