Ming-Omni TTS

Ming-Omni TTS TTS

A compact 0.5B omni-modal speech model with near-CD-quality 44.1kHz output and zero-shot voice cloning.

নিবন্ধন কৰক ৫,০০০ আখৰৰ বাবে সীমা

সঠিক নিয়ন্ত্ৰণৰ বাবে SSML টেগসমূহত আপোনাৰ টেক্সট আৱৰণ কৰক:

<speak><prosody rate="slow">Slow speech</prosody></speak>

নিৰ্বাচিত মডেলে বুজি পোৱা টেগসমূহ - আপোনাৰ টেক্সটত এটা ড্ৰপ কৰিবলৈ ক্লিক কৰক য'ত ই ঘটে:

এই আৰ্হি প্লেইন টেক্সট পঢ়ে, গতিকে ইনলাইন টেগসমূহ উপেক্ষা কৰা হয়। টেগ-ভিত্তিক আবেগসমূহৰ বাবে, Orpheus বা Bark ৰ দৰে এটা অভিব্যক্তিমূলক আৰ্হিলৈ পৰিবৰ্তন কৰক।

স্বনিৰ্বাচিত উচ্চাৰণ নিৰ্ধাৰণ কৰক (শব্দ = উচ্চাৰণ):

-12 +12
0.5x 2.0x
Piper, VITS, MeloTTS ৰ সৈতে মুক্ত
আপোনাৰ নিৰ্মিত অডিঅ' ইয়াত প্ৰদৰ্শিত হ'ব। এটা মডেল বাছক, টেক্সট লিখক, আৰু নিৰ্মাণ কৰক ক্লিক কৰক।
সফলতাৰে অডিঅ' নিৰ্মাণ কৰা হৈছে
0:00
অডিঅ' ডাউনল'ড কৰক .srt ডাউনল'ড কৰক ২৪ ঘন্টাত লিঙ্কৰ মেয়াদ উত্তীৰ্ণ হ'ব
মুক্ত স্তৰ: ব্যক্তিগত ব্যৱহাৰৰ বাবে। $5/মাহ পৰা বাণিজ্যিক লাইচেঞ্চ
TTS.ai ভাল পায়? আপোনাৰ বন্ধুসকলক কওক!

বিষয়ে Ming-Omni TTS

Ming-omni-tts-0.5B by inclusionAI is a compact omni-modal speech model built on the BailingMM dense backbone with a patch-by-patch flow-matching audio decoder. Despite its small 500M-parameter size, it outputs 44.1kHz audio approaching CD quality and supports zero-shot voice cloning from a reference of three seconds or more. It includes built-in emotion, dialect, and even background-music control driven by JSON instructions, and is notably stable — reporting a 0.83% word error rate on Chinese benchmarks. With Apache 2.0 licensing and modest 3GB VRAM needs, it fits high-fidelity bilingual narration, emotion-controlled voice acting, and Chinese audiobook production.

ইয়াৰ বাবে সৰ্বোত্তম: High-fidelity bilingual narration, emotion-controlled voice acting, Chinese audiobook content

সকলো ব্ৰাউছ কৰক Ming-Omni TTS শব্দ

এটা চমু দৃষ্টি

বিকাশক
inclusionAI
অনুমতি
Apache 2.0
টাইৰ
free
গতি
medium
শব্দ ক্লোনিং
হ্যাঁ
ভাষাসমূহ
English, Chinese
সৰ্বাধিক আখৰ
1000

Ming-Omni TTS শব্দ

Default

English
মুক্ত Neutral

Default (Chinese)

Chinese
মুক্ত Neutral

Ming-Omni TTS TTS - প্ৰায়শই সোধা প্ৰশ্নসমূহ

It outputs 44.1kHz audio, close to CD quality — high for a model of only 0.5B parameters — thanks to its patch-by-patch flow-matching audio decoder.

Beyond voice cloning, it supports emotion, dialect, and background-music control via JSON instructions, and it is very stable, reporting a 0.83% word error rate on Chinese benchmarks.

English and Chinese, with zero-shot voice cloning from a reference clip of three seconds or longer.
← সকলো শব্দ