النماذج المفتوحة المصدر لتحويل النص إلى كلمة

كل نموذج من نماذج ترجمة النصوص على منصتنا مفتوح المصدر، ومعظمها يستخدم MIT أو Apache 2.0. وبعض النماذج والأصوات مرخصة للاستخدام غير التجاري فقط وتحمل علامة "الاستخدام الشخصي وغير التجاري فقط". استخدمها من خلال برنامجنا البرنامجي المُستضاف، أو استضافتها بنفسك على بنية تحتية خاصة بك مع التحكم الكامل.

المصدر المفتوح ترخيص معهد ماساتشوستس للتكنولوجيا أباتشي 2.0 المستضيف الذاتي غيت هوب

جربها الآن

مجاني مع كوكورو، بايبر، فيتس، ميلو تي تي إس
سيظهر الصوت الذي أنتجته هنا
المولدة
0:00
تنزيل
أحب TTS.ai؟ أخبر أصدقائك!

فوائد المصادر المفتوحة لتكنولوجيا المعلومات والاتصالات

لماذا تمثل نماذج المصدر المفتوح أهمية لمشاريعك

جميع المصادر المفتوحة المرخصة

كل نموذج على TTS.ai هو مفتوح المصدر، وكل صفحة نموذج تتضمن ترخيصها. لا صناديق سوداء مملوكة ولا بيع قفل في.

تراخيص المصدر المفتوح

معظم النماذج مرخصة بموجب MIT أو Apache 2.0، وبعضها يستخدم تراخيص أخرى، والنماذج أو الأصوات المرخصة للاستخدام غير التجاري تحمل علامة "الاستخدام الشخصي وغير التجاري فقط".

المستضيف الذاتي

تحميل أي نموذج وتشغيله على معداتك الخاصة. التحكم الكامل على البيانات، التأخير، والبنية التحتية. لا يحتاج إلى الاعتماد على السحابة.

معالج رسوميات

النماذج هي الأمثل ل NVIDIA GPUs مع CUDA دعم. Piper يعمل على CPU فقط. معظم النماذج تحتاج 2-8GB VRAM للاستنتاج الكفؤ.

دعم المجتمع المحلي

وتقوم مجتمعات المصدر المفتوح النشطة بصيانة هذه النماذج وتحسينها. والمساهمات موضع ترحيب - تقدم الأخطاء، والتحسينات، والأصوات الجديدة على GitHub.

الترخيص التجاري متاح

الخطة المدفوعة من 5 دولار / شهر تحمل الترخيص التجاري لما تنتجه، بدون أي حقوق ملكية أو رسوم استخدام؛ المستوى المجاني للاستخدام الشخصي. تستبعد النماذج والأصوات المميزة "الاستخدام الشخصي وغير التجاري فقط".

فهرسنا للنموذج المفتوح المصدر

كل نموذج، ترخيصه، وما يفعله أفضل

KokoroKokoro

Free

Lightweight 82M parameter model delivering studio-quality speech with blazing-fast inference.

سريع 5/5

أفضل ل: Apache 2.0 - أفضل نوعية نموذج مجاني، 82M بارامترات، سهل الاستضافة الذاتية

حاول Kokoro

PiperPiper

Free

A fast, local neural text to speech system optimized for Raspberry Pi and embedded devices.

سريع 3/5

أفضل ل: معهد ماساتشوستس للتكنولوجيا - وحدة المعالجة المركزية فقط، مثالية لأجهزة الحافة والاستضافة الذاتية المدمجة

حاول Piper

VITSVITS

Free

Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech.

سريع 3/5

أفضل ل: معهد ماساتشوستس للتكنولوجيا - البنية اﻷساسية المستخدمة في كثير من النماذج الﻻحقة

حاول VITS

BarkBark

Standard

Transformer-based text-to-audio model that generates realistic speech, music, and sound effects.

بطيء 4/5

أفضل ل: معهد ماساتشوستس للتكنولوجيا - قدرات فريدة لتوليد الصوت تتجاوز الترجمة التحريرية التلقائية العادية

حاول Bark

Tortoise TTSTortoise TTS

Premium

Multi-voice text-to-speech focused on quality with autoregressive architecture.

بطيء 5/5 استنساخ الصوت

أفضل ل: Apache 2.0 - أقصى جودة، تنفيذ مرجعي درس على نطاق واسع

حاول Tortoise TTS

OpenVoiceOpenVoice

Premium

Instant voice cloning with granular control over style, emotion, and accent.

متوسطة 4/5 استنساخ الصوت

أفضل ل: معهد ماساتشوستس للتكنولوجيا - استنساخ صوتي مفتوح المصدر مع التحكم في اﻷسلوب الحبيبي

حاول OpenVoice

كيفية استخدام ترجمة النصوص إلى صوت مفتوحة المصدر

استخدم واجهة برمجة التطبيقات التي نستضيفها أو قم بتشغيل النماذج بنفسك

1

استكشاف نماذج المصدر المفتوح

تصفح كتالوجنا الذي يحتوي على أكثر من 20 نموذجاً مفتوح المصدر من نماذج ترجمة النصوص.

2

جرّب في متصفحك

اختبار أي نموذج مباشرة على TTS.ai دون تثبيت أي شيء. الخوادم GPU لدينا تتعامل مع المعالجة بحيث يمكنك تقييم الجودة قبل الالتزام بالاستضافة الذاتية.

3

استضافة ذاتية أو استخدام API

استنسخ مستودع النموذج من GitHub وتشغيله محليًا، أو استخدم تطبيق برمجة التطبيقات المستضاف الخاص بنا للإنتاج.

4

بنّي تطبيقك

دمج TTS في منتجك باستخدام نماذج ذاتية الاستضافة أو API REST. تحقق من كل ترخيص النموذج أولا: بعض النماذج والأصوات هي للاستخدام غير التجاري فقط.

مقارنة التراخيص

ترخيص لكل نموذج على TTS.ai

النموذج الترخيص الاستخدام التجاري التعديل الاستضافة الذاتية إسناد المسؤولية
Kokoro Apache 2.0 المطلوبة
Piper MIT أجهزة صوتية بعض الأصوات فقط اختياري
VITS MIT اختياري
MeloTTS MIT اختياري
Chatterbox MIT اختياري
Tortoise TTS Apache 2.0 المطلوبة
StyleTTS 2 MIT اختياري
OpenVoice MIT اختياري
Sesame CSM Apache 2.0 المطلوبة
Orpheus Llama 3.2 "Built with Llama"
Spark TTS CC BY-NC-SA 4.0 الاستخدام الشخصي وغير التجاري فقط المطلوبة
OuteTTS CC BY-NC-SA 4.0 الاستخدام الشخصي وغير التجاري فقط المطلوبة

الاستضافة الذاتية مقابل استضافة API

تشغيل النماذج بنفسك أو دعنا نتولى البنية التحتية

استضافة ذاتية على معداتك

كل نموذج على TTS.ai متاح كمشروع مفتوح المصدر على GitHub أو Hugging Face. قم بتنزيل الأوزان، وتثبيت التبعيات، وتشغيل الاستدلال على وحدات المعالجة الرسومية الخاصة بك. لديك السيطرة الكاملة على التأخير، والخصوصية، والقياس.

  • الخصوصية الكاملة للبيانات - لا يغادر الصوت خادومك أبدا
  • لا تكاليف لكل طلب بعد الإعداد الأولي
  • تحسين البيانات الخاصة بك
  • يتطلب معدات وحدة المعالجة الرسومية (موصى بها من NVIDIA)
  • أنت تدير التحديثات، القياس، والتبعيات

استخدام TTS.ai API المستضاف

احصل على وصول فوري إلى جميع النماذج الـ 20+ من خلال واجهة برمجة تطبيقات REST واحدة. نحن نتولى توفير وحدة المعالجة الرسومية، وتحديثات النموذج، وإدارة الصفوف، والتوسع. مفتاح واجهة برمجة تطبيقات واحد يعطيك الوصول إلى كل نموذج - لا حاجة إلى إدارة نشرات منفصلة.

  • لا توجد حاجة إلى معدات المعالجة الرسومية
  • جميع النماذج الـ 20+ من خلال واجهة واحدة
  • تحديثات وتحسينات نموذجية آلية
  • 99.9 في المائة من وقت التشغيل مع وجود بنية تحتية زائدة
  • لا تدفع إلا لما تستخدمه

البداية السريعة: API أو Self-Host

استخدم واجهة برمجة التطبيقات المستضافة لدينا أو قم بتركيب كوكورو محليا في دقائق

الخيار 1: برنامج TTS.ai المستضيف أسهل
import requests

response = requests.post("https://api.tts.ai/v1/tts", json={
    "text": "Open source TTS with a simple API.",
    "model": "kokoro",
    "voice": "af_heart",
    "format": "wav"
}, headers={"Authorization": "Bearer YOUR_API_KEY"})

with open("output.wav", "wb") as f:
    f.write(response.content)
الخيار 2: الاستضافة الذاتية بنظام " pip " السيطرة الكاملة
# Install Kokoro locally
pip install kokoro

# Generate speech on your own GPU
import kokoro

pipeline = kokoro.KPipeline(lang_code="a")
generator = pipeline("Hello from your own server!", voice="af_heart")
for i, (gs, ps, audio) in enumerate(generator):
    kokoro.save(audio, f"output_{i}.wav")

المصدر المفتوح، التسعير الميسور

API المستضافة لدينا تجعل المصدر المفتوح TTS متاحا دون إدارة GPUs.

المستوى المجاني

$0

50 نقطة عند التسجيل

  • 4 نماذج مفتوحة المصدر مجانية
  • لا يلزم التسجيل للاستخدام الأساسي
  • الاستخدام الشخصي غير التجاري

بدء التشغيل

$9

000 500 حرف/شهر

  • جميع النماذج المفتوحة المصدر البالغ عددها 20+
  • استنساخ الصوت
  • الوصول إلى برمجيات التطبيقات

المؤيدون

$29

000 000 2 حرف/شهر

  • أولوية معالجة وحدة المعالجة المركزية
  • جميع النماذج العالية الجودة
  • دعم المؤسسات
انظر التسعير الكامل

الأسئلة المتكررة

الأسئلة الشائعة حول تحويل النصوص إلى صوت مفتوح المصدر

نعم، كل نموذج على TTS.ai مفتوح المصدر، ومعظمها يستخدم MIT أو Apache 2.0. القليل يستخدم تراخيص أخرى، بما في ذلك بعض المرخصة للاستخدام غير التجاري فقط، والتي تحمل علامة "الاستخدام الشخصي وغير التجاري فقط" في اختيار الصوت. كل صفحة نموذج تتضمن ترخيصها.

إن كلا الترخيصين من تراخيص المصدر المفتوح المتساهلة التي تسمح بالاستخدام التجاري، والتعديل، وإعادة التوزيع. ويضيف أباشي 2.0 منح براءات اختراع صريحة ويتطلب ذكر التغييرات إذا قمت بتعديل الشفرة. أما معهد ماساتشوستس للتكنولوجيا فهو أبسط ويتطلب متطلبات أقل. وكلاهما صديق للأعمال التجارية.

نعم. يمكن استضافة كل نموذج بنفسه. استنساخ مستودع النموذج من GitHub، وتثبيت التبعيات، وتنزيل أوزان النموذج، وتشغيل الاستدلال. ونحن نقدم الوثائق لمتطلبات الاستضافة الذاتية لكل نموذج بما في ذلك وحدة المعالجة المركزية، وذاكرة الوصول العشوائي، وإصدار بايثون.

تختلف المتطلبات حسب النموذج. لا يحتاج Piper إلى وحدة معالجة رسومية (وحدة المعالجة المركزية فقط). يحتاج Kokoro و MeloTTS إلى 1-2GB VRAM. معظم النماذج القياسية تحتاج إلى 4GB VRAM. يحتاج Tortoise و Sesame CSM إلى 8GB. يمكن لـ NVIDIA RTX 3060 (12GB) تشغيل معظم النماذج بكل راحة.

نعم. تراخيص المصدر المفتوح تسمح بالتعديل بما في ذلك الصقل. النماذج مثل GPT-SoVITS و Bark توفر نصوص الصقل. يمكنك تدريب النماذج على بياناتك الصوتية الخاصة لإنشاء أصوات مخصصة أو تحسين الأداء بلغات محددة.

إن أفضل النماذج المفتوحة المصدر (كوكورو، وستايل تي تي إس 2، وشاتربوكس) تعادل أو تتجاوز الآن الخدمات التجارية مثل إيليفنلابس وجوجل تي تي إس في معايير الجودة. والميزة الرئيسية للخدمات التجارية هي البنية الأساسية المدارة والدعم، وليس جودة الصوت.

تم إزالة بعضها: XTTS/XTTS-v2 (Coqui's CPML، غير تجاري)، F5-TTS (CC-BY-NC، غير تجاري) و Higgs-v2 (Boson License، تقييدي). بعض النماذج والأصوات المتبقية، مثل Spark TTS، OuteTTS ومعظم أصوات بايب، مرخصة للاستخدام غير التجاري فقط؛ وهي تحمل علامة "الاستخدام الشخصي وغير التجاري فقط" في اختيار الصوت، لذلك استخدم صوتًا مختلفًا للمشاريع التجارية.

نعم. معظم النماذج تقبل مساهمات المجتمع عبر GitHub. يمكنك تقديم تقارير الأخطاء، والتسجيلات الصوتية للغات الجديدة، وتحسينات الشفرة، والوثائق. تحقق من مستودع GitHub لكل نموذج للحصول على مبادئ توجيهية للمساهمة والقضايا النشطة.

تحميل النماذج عند الطلب وتفريغها عندما تكون خاملة لتقاسم ذاكرة وحدة المعالجة الرسومية. يقوم خادم وحدة المعالجة الرسومية بتشغيل أكثر من 20 نموذجا على 4x Tesla P40 (إجمالي VRAM 96 جيجا بايت) باستخدام التحميل الديناميكي.

العديد من النماذج توفر صور Docker الرسمية أو Dockerfiles. لتشغيل نماذج متعددة، يمكنك بناء تركيب Docker الشخصية مع NVIDIA Container Toolkit للوصول إلى وحدة المعالجة الرسومية. يمكن أن تكون بنية خادم API لدينا بمثابة تنفيذ مرجعي.

معظم النماذج تتطلب بايثون 3.10-3.12. Coqui TTS (VITS) يحتاج على وجه التحديد بايثون 3.11. نوصي بايثون 3.12 لمعظم النماذج. تحقق من كل نموذج requirements.txt للتوافق الدقيق للنسخة.

إذا كنت تستضيف نفسك، في الغالب نعم: تراخيص MIT و Apache 2.0 تسمح صراحة بالاستخدام التجاري، ومعظم النماذج هنا تستخدمها، لذا يمكنك بناء منتجات SaaS، والتطبيقات المحمولة، والألعاب والخدمات بدون رسوم ترخيص أو حقوق الملكية. تحقق من الترخيص على كل صفحة نموذج أولاً، لأن بعض النماذج والأصوات غير تجارية. الصوت الذي يولد على TTS.ai نفسه يتبع خطتك: الاستخدام الشخصي على المستوى المجاني، والاستخدام التجاري على أي خطة مدفوعة.
5.0/5 (1)

ما الذي يمكننا تحسينه؟ تساعدنا تعليقاتكم على حل المشاكل.

جرب ترجمة الصوت إلى لغة مكتوبة مفتوحة المصدر اليوم

20+ نماذج مفتوحة المصدر، كل منها مع ترخيصها المدرجة. استخدام API أو self-host، الاختيار لك.