VibeVoice TTS
Microsoft's multi-speaker long-form model that generates up to 90 minutes with 4 distinct speakers.
Apvynioti savo tekstą BSML žymės tiksliam valdymui:
<speak><prosody rate="slow">Slow speech</prosody></speak>
Žymos pasirinktas modelis supranta — spustelėkite, kad įmestų vieną į tekstą, kur tai atsitinka:
Šis modelis skaito paprastą tekstą, todėl į eilę orientuotos žymės yra ignoruojamos. Dėl įsagų pagrindu išreikštos emocijos pereikite prie tokio išraiškingo modelio kaip Orpheus arba Bark.
Apibrėžti užsakymą tarimas (žodžio = tarimas):
Apie VibeVoice
VibeVoice from Microsoft is built for long-form, multi-speaker audio. Its 1.5B model can generate up to 90 minutes of speech with as many as 4 simultaneous speakers, using speaker tags to drive multi-turn dialogue — a strong fit for podcasts, audiobooks, and conversations that need speaker consistency across long passages. A separate Realtime 0.5B variant reaches roughly 300ms latency for interactive use. On TTS.ai it covers English and Chinese and accepts up to 50,000 characters per request, so an entire episode can be scripted in one pass.
Geriausia: Podcasts, dialogues, long-form narration, multi-speaker content
Naršyti viską VibeVoice balsaiIš pirmo žvilgsnio
- Programuotojas
- Microsoft
- Licencija
- MIT
- Pakopa
- standard
- Greitis
- fast
- Balso klonavimas
- Nr.
- Kalbos
- English, Chinese
- Daugiausia simbolių
- 50000