የጽሑፍ ወደ ንግግር ሞዴሎች

በፕላትፎርማችን ላይ ያለው የቲቲኤስ ሞዴል ሁሉ የግል ነው፣ አብዛኛዎቹም ሚት ወይም አፓቺ 2.0 ይጠቀማሉ፡፡ ጥቂት ሞዴሎችና ድምጾች ለነፃነት ጥቅም ብቻ ነው የተሰጣቸው እና 'የግል እና ነፃነት ጥቅም ብቻ' ተብሎ ተጽፏል። በሆስቴድ ፒአይፒ (API) ውስጥ ይጠቀሙዋቸው፣ ወይም በሙሉ ቁጥጥር በራስዎ ኢንፎርሜሽን ቴክኖሎጂ ላይ ይጠቀሙዋቸው።

የክፍል ፋይል MIT ፈቃድ አፓቺ 2.0 ራስ-አስተናጋጅ ጂትሆብ

አሁን ይሞክሩት

ነጻ ከኮኮሮ, ፒፐር, VITS, MeloTTS ጋር
የድምፅ ፋይል
የተፈጠረ
0:00
ያውርዱ
TTS.aiን ወዳጅነት?

የ TTS ጥቅሞች

የክፍል 1 ፋይሎች

ሁሉንም የክፈት ምንጭ ፈቃዶች

በ TTS.ai ላይ ያለውን ሞዴል ሁሉ የከፈተ ምንጭ ነው, እና ሞዴል ገጽ ሁሉ ውል ዝርዝር. ምንም የግል ጥቁር ሳጥኖች እና ምንም ሻጭ lock-in.

የክፈት ምንጭ

አብዛኛዎቹ ሞዴሎች MIT ወይም Apache 2.0 ስር ሊሰጥ የሚችል ነው። ጥቂቶቹ ሌሎች ሊሰጥ የሚችል የሆኑ ሞዴሎችን ይጠቀማሉ፣ እና ሞዴሎች ወይም ድምጾች ለሌላ ጥቅም ሊሰጥ የሚችል "የግል እና ያልሆነ የግል ጥቅም ብቻ" ተብሎ ይጠራሉ።

ራስ-አስተናጋጅ

ማንኛውንም ሞዴል ያውርዱ እና በራስዎ ሃርድዌር ላይ ይጫኑት. በእርስዎ መረጃ ላይ ሙሉ ቁጥጥር፣ latency እና ኢንፍራሬድ. ምንም የክፍል ግድግዳ ተጽዕኖ የለም.

GPU የተሻሻለ

ሞዴሎች ለNVIDIA GPUs ከ CUDA ድጋፍ ጋር የተሻሻሉ ናቸው. ፓይፐር በ CPU ብቻ ይሠራል. አብዛኛዎቹ ሞዴሎች 2-8GB VRAM ለተሻለ ውጤት ያስፈልጋሉ.

የጋራ

እነዚህን ሞዴሎች የሚጠብቁና የሚያሻሽሉ አክቲቭ የክፈት ምንጭ ማህበረሰቦች አሉ። አስተዋጽኦዎች ይቀበላሉ - ብልሽቶችን፣ ማሻሻያዎችን እና አዲስ ድምጾችን በ GitHub ላይ ያቅርቡ።

የኮሜርስ ፈቃድ

ከ$5/ወር የሚከፈል ዕቅድ ለሚፈጥሩት ነገር የኮሜርሺያል ሌዘርን ይሸከምል፣ ምንም ሮያልቲ ወይም የጠቀሜታ ክፍያ የሌለው፤ ነፃ ደረጃ ለግል ጥቅም ነው። ሞዴሎች እና "የግል እና ያልኮሜርሺያል ጥቅም ብቻ" የተባሉ ድምጾች ይታያሉ፡፡

የምንችለው የክፈት ምንጭ ሞዴል ካታሎግ

ሞዴል ሁሉ፣ ውል እና ምን ያህል ጥሩ ነው

KokoroKokoro

Free

Lightweight 82M parameter model delivering studio-quality speech with blazing-fast inference.

ቀጥ ያለ 5/5

ምርጥ ለ: አፓቺ 2.0 - ምርጥ ጥራት ነፃ ሞዴል, 82M params, ራስ-አስተናጋጅ ቀላል

ሞክሩ Kokoro

PiperPiper

Free

A fast, local neural text to speech system optimized for Raspberry Pi and embedded devices.

ቀጥ ያለ 3/5

ምርጥ ለ: MIT — CPU-only, ለ Edge መሣሪያዎች እና ለተካተተ ራስ-አስተናጋጅ ሙሉ

ሞክሩ Piper

VITSVITS

Free

Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech.

ቀጥ ያለ 3/5

ምርጥ ለ: MIT - በብዙ የታችኛው ሞዴሎች የተጠቀሙት የመሰረት ሕንፃ

ሞክሩ VITS

BarkBark

Standard

Transformer-based text-to-audio model that generates realistic speech, music, and sound effects.

ቀስ በቀስ 4/5

ምርጥ ለ: MIT — ልዩ የድምፅ ማምረቻ ችሎታዎች ከስታንዳርድ TTS በላይ

ሞክሩ Bark

Tortoise TTSTortoise TTS

Premium

Multi-voice text-to-speech focused on quality with autoregressive architecture.

ቀስ በቀስ 5/5 የድምፅ ክሎኒንግ

ምርጥ ለ: አፓቺ 2.0 - ከፍተኛ ጥራት ያለው, በስፋት የተማረ መነሻ ተግባራዊ

ሞክሩ Tortoise TTS

OpenVoiceOpenVoice

Premium

Instant voice cloning with granular control over style, emotion, and accent.

መሀከል 4/5 የድምፅ ክሎኒንግ

ምርጥ ለ: MIT - የግልጽ ምንጭ የድምፅ ክሎኒንግ በግሬናር ስታይል ቁጥጥር

ሞክሩ OpenVoice

Open Source TTS እንዴት መጠቀም እንደሚቻል

የተቀመጠውን API ይጠቀሙ ወይም ሞዴሎችን በራስዎ ይጀምሩ

1

የክፈት ምንጭ ሞዴሎችን ይጎብኙ

የ 20+ ክፍት ምንጭ የ TTS ሞዴሎችን ካታሎግ ይጎብኙ። የሞዴል ገጽ እያንዳንዱን ፈቃድ፣ አርክቴክቸር፣ ችሎታዎችን እና የራስ-አስተናጋጅ ፍላጎቶችን ያሳያል።

2

በድረ-ገጹ ላይ ይሞክሩ

ማንኛውም ሞዴል በቀጥታ በ TTS.ai ላይ ምንም ሳያስተካክሉ ይሞከሩ. የ GPU ሰርቨሮቻችን ሂደቱን ያስተዳድራሉ ስለዚህ ራስዎን ከማስተዳደርዎ በፊት ጥራቱን ማረጋገጥ ይችላሉ.

3

ራስ-አስተናጋጅ ወይም APIችንን ይጠቀሙ

ከ GitHub ክሎን ሞዴል ሪፖዎች እና በከተማው ውስጥ ይንቀሳቀሱ፣ ወይም ለምርት የተቀመጠውን API እንጠቀማለን። ራስ-አስተናጋጅ ሙሉ ቁጥጥር ይሰጣል፤ APIችን የተስተዳደረ የመሰረተ ልማት ይሰጣል ፡፡

4

ፕሮግራማችሁን ገንቡ

TTS በራስ-አስተናጋጅ ሞዴሎችን ወይም የREST API ን በመጠቀም በምርትዎ ውስጥ ያካትቱ። የሞዴል ውል በመጀመሪያ ይመልከቱ: ጥቂት ሞዴሎች እና ድምጾች ለነፃነት ጥቅም ብቻ ናቸው።

የፈቃድ ማመሳሰል

License of each model on TTS.ai

ሞዴል ፈቃድ የምርት መጠቀም ለውጥ ራስ-አስተናጋጅ አንቀጽ
Kokoro Apache 2.0 ያስፈልጋል
Piper MIT መሳሪያዎች አንዳንድ ድምጾች ብቻ ምርጫዎች
VITS MIT ምርጫዎች
MeloTTS MIT ምርጫዎች
Chatterbox MIT ምርጫዎች
Tortoise TTS Apache 2.0 ያስፈልጋል
StyleTTS 2 MIT ምርጫዎች
OpenVoice MIT ምርጫዎች
Sesame CSM Apache 2.0 ያስፈልጋል
Orpheus Llama 3.2 "Built with Llama"
Spark TTS CC BY-NC-SA 4.0 የግል እና ያልተሸጠ ያስፈልጋል
OuteTTS CC BY-NC-SA 4.0 የግል እና ያልተሸጠ ያስፈልጋል

ራስ-አስተናጋጅ vs የተቀመጠው API

ሞዴሎችን በራስህ ይጫን ወይም መሰረተ ልማትን እንይዝ

የራስ-አስተናጋጅ በሃርድዌርዎ ላይ

በ TTS.ai ላይ ያለው ሁሉ ሞዴል በ GitHub ወይም በ Hugging Face ላይ እንደ ክፍት ምንጭ ፕሮጀክት ይገኛል. ክብደቶችን ያውርዱ ፣ ተያያዥነትን ያስተካክሉ ፣ እና በራስዎ GPUs ላይ ውጤቶችን ይጫኑ ፡፡ በ latency ፣ በግልጽነት እና በመለካት ላይ ሙሉ ቁጥጥር አለዎት ፡፡

  • የተሟላ የዳታ ደህንነት - ድምፅ ሰርቨርዎን አይለቅም
  • ከመጀመሪያው ማዘጋጀት በኋላ በአንድ ጥያቄ ላይ ምንም ወጪዎች የሉም።
  • የግል መረጃዎን በራስ-ሰር ማስተካከል
  • የጂፒዩ ሃርድዌር ያስፈልጋል (NVIDIA የተመረጠ)
  • ማሻሻያዎችን ማስተዳደር፣ ማሳደግ፣ እና ተያያዥነት

TTS.ai የተቀመጠው API ይጠቀሙ

በአንድ REST API ውስጥ ወደ ሁሉም 20+ ሞዴሎች ቀጥተኛ መዳረሻ ማግኘት ይችላሉ. የ GPU አቅርቦትን ፣ የሞዴል ማሻሻያዎችን ፣ የፍለጋ አስተዳደርን እና ማሳደግን እንመለከታለን ፡፡ አንድ API ቁልፍ ለሁሉም ሞዴል መዳረሻ ይሰጣል - የተለየ ማሰራጨትን ለመቆጣጠር ምንም ችግር የለም ፡፡

  • የGPU ሃርድዌር የለም
  • ሁሉም 20+ ሞዴሎች በአንድ API
  • አውቶማቲክ ሞዴል ማሻሻያዎች እና ማሻሻያዎች
  • 99.9% ተጨማሪ የመሰረተ ልማት ጋር አፕታይም
  • ለሚጠቀሙት ብቻ ይከፍሉ

የፍጥነት መጀመር: API ወይም ራስ-ሆስት

የኮኮሮን መተግበሪያዎች

ምርጫ 1: TTS.ai የተቀመጠው API ቀላል
import requests

response = requests.post("https://api.tts.ai/v1/tts", json={
    "text": "Open source TTS with a simple API.",
    "model": "kokoro",
    "voice": "af_heart",
    "format": "wav"
}, headers={"Authorization": "Bearer YOUR_API_KEY"})

with open("output.wav", "wb") as f:
    f.write(response.content)
ምርጫ 2: ራስ-አስተናጋጅ ሙሉ ቁጥጥር
# Install Kokoro locally
pip install kokoro

# Generate speech on your own GPU
import kokoro

pipeline = kokoro.KPipeline(lang_code="a")
generator = pipeline("Hello from your own server!", voice="af_heart")
for i, (gs, ps, audio) in enumerate(generator):
    kokoro.save(audio, f"output_{i}.wav")

የክፍል ፋይል

የምንይዘው API የግልጽ ምንጭ TTSን GPUs ሳይመሩ ለመድረስ ያስችላል

ነጻ ደረጃ

$0

50 በመመዝገብ ላይ ክሬዲቶች

  • 4 ክፍት ምንጭ ሞዴሎች ነፃ
  • ለመሰረታዊው ጥቅም ምንም መመዝገብ የለም
  • የግል፣ ያልተሸጠ

መተላለፊያ

$9

ፊደላት

  • ሁሉንም 20+ የክፈት ምንጭ ሞዴሎች
  • የድምፅ ቅጂ
  • API መዳረሻ

ለ

$29

2,000,000 አርእስቶች/ወር

  • የGPU ምርጫዎች
  • ሁሉንም ተጨማሪ ሞዴሎች
  • የድርጅት ድጋፍ
ሙሉ ዋጋ

ብዙ ጊዜ የሚጠየቁ ጥያቄዎች

የጽሑፍ-ወደ-ንግግር የትርጉም አማራጭ

አዎ፣ በTTS.ai ላይ ያለው ሞዴል ሁሉ የከፈተ ምንጭ ነው፣ አብዛኛዎቹም MIT ወይም Apache 2.0 ይጠቀማሉ፡፡ ጥቂቶቹ ሌሎች ፈቃዶችን ይጠቀማሉ፣ በድምፅ መረጣው ውስጥ "የግል እና ያልተሸጠው" የሚል ምልክት ያለውን ለሌላ ያልተሸጠው ጥቅም ብቻ የተሰጠ ፈቃድ ጨምሮ። ሞዴል ገጽ ሁሉ ፈቃዱን ይዘረዝራል።

ሁለቱም የፍቃድ የክፍል-መነሻ ፈቃዶች የኮሜርሺያል ጥቅም, ለውጥ, እና መለዋወጥ ይፈቅዳል. አፓቺ 2.0 ግልጽ ፔትኔት ሽልማቶችን ይጨምራል እና ኮድዎን ብትለውጡ ለውጦችን መናገር ያስፈልጋል. MIT በጥቂት መስፈርቶች ቀላል ነው. ሁለቱም የቢዝነስ-ወዳጅ ናቸው.

አዎ. ሁሉም ሞዴል በራሱ ሊቀመጥ ይችላል. ሞዴል መዝገብ ቤትን ከ GitHub ክሎን፣ ተያያዥነት ይጫኑ፣ ሞዴል ክብደት ይጫኑ፣ እና ውጤት ይጫኑ. እኛ ለእያንዳንዱ ሞዴል የራሱን የሆስት ማድረግ ፍላጎቶች GPU, RAM, እና Python ስሪት ጨምሮ ሰነዶችን እንሰጣለን.

ፍላጎቶች በሞዴል ይለያያሉ. ፓይፐር ምንም ጂፒዩ (ሲፒዩ ብቻ) አያስፈልገውም. ኮኮሮ እና MeloTTS 1-2GB VRAM ያስፈልጋሉ. አብዛኛዎቹ መደበኛ ሞዴሎች 4GB VRAM ያስፈልጋሉ. Tortoise እና Sesame CSM 8GB ያስፈልጋሉ. NVIDIA RTX 3060 (12GB) አብዛኛዎቹን ሞዴሎች በቀላሉ ሊሠራ ይችላል.

አዎ. የክፈት ምንጭ ፈቃዶች ማሻሻያዎችን ጨምሮ ማሻሻያዎችን ይፈቅዳሉ. እንደ GPT-SoVITS እና Bark ያሉ ሞዴሎች ማሻሻያ ስክሪፕቶችን ይሰጣሉ. የራሳችሁን የድምፅ ውሂብ በመጠቀም የራሳችሁን ድምጾች ለመፍጠር ወይም ለተወሰኑ ቋንቋዎች ውጤታማነትን ለማሻሻል ሞዴሎችን ማሠልጠን ይችላሉ።

ከላይ የተጠቀሱት የፍለጋ ሞዴሎች (ኮኮሮ፣ ስታይልቲቲኤስ 2፣ ቻተርቦክስ) አሁንም እንደ ኤሌቬንላብስ እና ጎግል ቲቲኤስ የመሳሰሉ የኮምፒውተር ቴክኖሎጂ አገልግሎት አቅራቢዎችን በጥራት ማሳያ ደረጃዎች ያሟላሉ ወይም ይበልጣሉ፡፡ የኮምፒዩተር ቴክኖሎጂ አገልግሎት አቅራቢዎች ዋናው ጥቅም የተስተዳደሩ የመሰረተ ልማት እና ድጋፍ ነው፣ የድምፅ ጥራት አይደለም።

አንዳንድ ተለወጡ: XTTS/XTTS-v2 (Coqui's CPML, non-commercial), F5-TTS (CC-BY-NC, non-commercial) እና Higgs-v2 (Boson License, restrictive). ጥቂት የቀሩ ሞዴሎች እና ድምጾች, እንደ ስፓርክ TTS, OuteTTS እና አብዛኛዎቹ የፒፐር ድምጾች, ለነፃነት ጥቅም ብቻ ነው ተቀባይነት ያላቸው; እነርሱ "የግል እና ነፃነት ጥቅም ብቻ" በድምፅ መረጣው ውስጥ ምልክት ተደርገዋል, ስለዚህ ለነፃነት ፕሮጀክቶች የተለየ ድምፅ ይጠቀሙ.

አዎ. አብዛኛዎቹ ሞዴሎች በ GitHub አማካኝነት የጋራ አስተዋፅኦዎችን ይቀበላሉ. የጥፋት ሪፖርቶችን፣ ለአዲስ ቋንቋዎች የድምፅ ማስመዝገቦችን፣ የኮድ ማሻሻያዎችን እና ማስረጃዎችን ማቅረብ ይችላሉ። ለእያንዳንዱ ሞዴል የ GitHub መዝገብ ቤትን ለተሳትፎ መመሪያዎች እና ለሚከሰቱ ችግሮች ይመልከቱ።

የጂፒዩ ሰርቨር 20+ ሞዴሎችን በ 4x ቴስላ P40 (96GB ሙሉ VRAM) ላይ በዲናሚክ መጫን ይጠቀማል. ለራስ-አስተናጋጅ, አንድ 24GB ጂፒዩ 3-5 ሞዴሎችን በአንድ ጊዜ ሊሰጥ ይችላል.

ብዙ ሞዴሎች የዶክተር ምስሎችን ወይም የዶክተር ፋይሎችን ይሰጣሉ. ብዙ ሞዴሎችን ለመስራት ፣ ለጂፒዩ መዳረሻ NVIDIA Container Toolkit ጋር የዶክተርን ማስተካከያ መፍጠር ይችላሉ ፡፡ የ API ሰርቨር አርክቴክቸር እንደ መነሻ ተግባራዊነት ሊሠራ ይችላል ፡፡

አብዛኛዎቹ ሞዴሎች Python 3.10-3.12 ያስፈልጋሉ. Coqui TTS (VITS) Python 3.11 ያስፈልጋል. Python 3.12 ለብዙ ሞዴሎች እንመክራለን. ለእያንዳንዱ ሞዴል requirements.txt ን ለቅደም ተከተል ማጣመር.

ራስ-አስተናጋጅ ከሆነ, አብዛኛውን ጊዜ አዎን: MIT እና አፓቺ 2.0 ፈቃዶች በግልጽ የቢዝነስ ጥቅም ይቀበላሉ, እና ብዙ ሞዴሎች እዚህ እነርሱን መጠቀም, ስለዚህ SaaS ምርቶች, የሞባይል መተግበሪያዎች, ጨዋታዎች እና አገልግሎት ያለ ፈቃድ ክፍያዎች ወይም royalties መገንባት ይችላሉ. በእያንዳንዱ ሞዴል ገጽ ላይ ፈቃድ በመጀመሪያ ይመልከቱ, ምክንያቱም ጥቂት ሞዴሎች እና ድምጾች የቢዝነስ አይደለም. በ TTS.ai ላይ የተፈጠረው ድምፅ ራሱን የእርስዎን ዕቅድ ይከተላል: የግል ጥቅም በነጻ ደረጃ, የቢዝነስ ጥቅም በእያንዳንዱ የተከፈለ ዕቅድ ላይ.
5.0/5 (1)

ምን ማሻሻል እንችላለን? አስተያየቶችዎ ችግሮችን ለመፍታት ይረዳሉ.

የኦፕን-ሶርስ TTS ዛሬ ይሞክሩ

20+ የክፍል-መነሻ ሞዴሎች, ሁሉም በሊዝበን ውስጥ ተዘርዝረዋል. የ API ወይም የራስ-ሆስትን ይጠቀሙ, ምርጫው የእናንተ ነው.