VibeVoice 音声翻訳
Microsoft's multi-speaker long-form model that generates up to 90 minutes with 4 distinct speakers.
SSML タグでテキストを囲み、正確な制御を行う:
<speak><prosody rate="slow">Slow speech</prosody></speak>
選択したモデルが理解するタグ - クリックしてテキストにドラッグします:
このモデルは単純テキストを読み込み、インラインタグは無視されます。タグベースの感情を表現するには、Orpheus や Bark のような表現モデルに切り替えてください。
カスタム発音を定義 (単語=発音):
情報 VibeVoice
VibeVoice from Microsoft is built for long-form, multi-speaker audio. Its 1.5B model can generate up to 90 minutes of speech with as many as 4 simultaneous speakers, using speaker tags to drive multi-turn dialogue — a strong fit for podcasts, audiobooks, and conversations that need speaker consistency across long passages. A separate Realtime 0.5B variant reaches roughly 300ms latency for interactive use. On TTS.ai it covers English and Chinese and accepts up to 50,000 characters per request, so an entire episode can be scripted in one pass.
適合する: Podcasts, dialogues, long-form narration, multi-speaker content
すべてブラウズ VibeVoice 声概要
- 開発者
- Microsoft
- ライセンス
- MIT
- 動物
- standard
- スピード
- fast
- 声のクローン
- いや
- 言語
- English, Chinese
- 最大文字数
- 50000