Паведаміць пра памылку / запыт на магчымасць

Модулі пераўтварэньня тэксту ў мову з адкрытым зыходным кодам

Every TTS model on our platform is open source, and most use MIT or Apache 2.0. A few models and voices are licensed for non-commercial use only and are marked 'Personal and non-commercial use only'. Use them through our hosted API, or self-host them on your own infrastructure with full control.

Адкрыты код Ліцэнзія MIT Apache 2.0 Самастойны GitHubGenericName

Паспрабуйце зараз

Свабодны з Kokoro, Piper, VITS, MeloTTS
Ваша створанае гучанне з' явіцца тут
Створана
0:00
Сцягнуць
Любіце TTS.ai? Раскажыце сваім сябрам!

Перавагі TTS з адкрытым кодам

Чаму мадэлі з адкрытым зыходным кодам важныя для вашых праектаў

Усе адкрытыя ліцэнзіі

Кожная мадэль на TTS.ai з' яўляецца адкрытым кодам, і кожная старонка мадэлі змяшчае яе ліцэнзію. Няма ўласных чорных скрыняў і не існуе замка вытворцы.

Ліцэнзіі адкрытага кода

Most models are licensed under MIT or Apache 2.0. A few use other licenses, and models or voices licensed for non-commercial use are marked "Personal and non-commercial use only".

Самастойны

Спампаваць любую мадэль і запусціць яе на сваім апаратным забеспячэнні. Поўны кантроль над вашымі дадзенымі, латэнцыяй і інфраструктурай. Не патрабуецца залежнасць ад хмарачоса.

Аптымізавана для GPU

Мадэлі аптымалізаваныя для графічных працэсараў NVIDIA з падтрымкай CUDA. Piper працуе толькі на працэсарах. Большасць мадэляў патрабуюць 2- 8 ГБ VRAM для эфектыўнага вываду.

Падтрымка супольнасці

Актыўныя супольнасці з адкрытым зыходным кодам падтрымліваюць і ўдасканальваюць гэтыя мадэлі. Запрашаем да ўдзелу — паведамляйце пра памылкі, паляпшэнні і новыя галасы на GitHub.

Даступная камерцыйная ліцэнзія

Плацежны план ад $5/месяц дае вам камерцыйную ліцэнзію на тое, што вы ствараеце, без аплаты аўтарскіх правоў і карыстацкіх збораў; бясплатны ўзровень прызначаны для асабістага выкарыстання. Модэлі і голасу, пазначаныя "Толькі для асабістага і некамэрцыйнага выкарыстання", выключаюцца.

Наш каталог мадэляў з адкрытым зыходным кодам

Кожная мадэль, яе ліцэнзія і тое, што яна робіць найлепш

KokoroKokoro

Free

Lightweight 82M parameter model delivering studio-quality speech with blazing-fast inference.

Захаваць 5/5

Лепшы для: Apache 2. 0 — найлепшая якасная свабодная мадэль, 82М параметраў, лёгкае самаабслугоўванне

Спроба Kokoro

PiperPiper

Free

A fast, local neural text to speech system optimized for Raspberry Pi and embedded devices.

Захаваць 3/5

Лепшы для: MIT — толькі CPU, ідэальна падыходзіць для краевых прылад і ўбудаванага самаабслугоўвання

Спроба Piper

VITSVITS

Free

Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech.

Захаваць 3/5

Лепшы для: MIT — асноўная архітэктура, якая выкарыстоўваецца многімі мадэлямі

Спроба VITS

BarkBark

Standard

Transformer-based text-to-audio model that generates realistic speech, music, and sound effects.

Павольны 4/5

Лепшы для: MIT — унікальныя магчымасці генерацыі аўдыё за межамі стандартнага TTS

Спроба Bark

Tortoise TTSTortoise TTS

Premium

Multi-voice text-to-speech focused on quality with autoregressive architecture.

Павольны 5/5 Клонаванне голасу

Лепшы для: Apache 2. 0 - максімальна якасная, шырока вывучаная рэалізацыя

Спроба Tortoise TTS

OpenVoiceOpenVoice

Premium

Instant voice cloning with granular control over style, emotion, and accent.

Носьбіт 4/5 Клонаванне голасу

Лепшы для: MIT — клянаваньне голасу з адкрытым зыходным кодам з дробным кіраваньнем стылямі

Спроба OpenVoice

Як карыстацца адкрытым кодам TTS

Выкарыстоўвайце наш хоставаны API або запусьціце мадэлі самастойна

1

Дасьледаваньне мадэляў з адкрытым зыходным кодам

Праглядзіце наш каталог з больш чым 20 мадэлямі TTS з адкрытым зыходным кодам. Кожная старонка мадэлі паказвае ліцэнзію, архітэктуру, магчымасці і патрабаванні да самога хостынгу.

2

Паспрабуйце ў вашым браўзэры

Праверце любую мадэль прама на TTS.ai, не ўсталёўваючы нічога. Нашы серверы GPU займаюцца апрацоўкай, таму вы можаце ацаніць якасць перад тым, як прыступіць да самастойнага хостынгу.

3

Выкарыстоўвайце наш API

Клонаваць рэпазіторыі мадэляў з GitHub і запускаць лакальна, або выкарыстоўваць наш хоставаны API для вытворчасці. Само-хостынг дае поўны кантроль; наш API забяспечвае кіраваную інфраструктуру.

4

Збудаваць праграмуName

Інтэграваць TTS у свой прадукт, выкарыстоўваючы мадэлі, размешчаныя на вашым кампутары, або наш REST API. Перш за ўсё праверце ліцэнзію кожнай мадэлі: некаторыя мадэлі і голасу прызначаныя толькі для некамэрцыйнага выкарыстання.

Параўнанне ліцэнзій

Ліцэнзія кожнай мадэлі на TTS.ai

Модуль Ліцэнзія Камерцыйнае выкарыстанне Змяненне Сам- вузел Прызванне
Kokoro Apache 2.0 Неабходны
Piper MIT рухавік; ліцэнзіі голасу розныя Толькі некаторыя голасу Неабавязковы
VITS MIT Неабавязковы
MeloTTS MIT Неабавязковы
Chatterbox MIT Неабавязковы
Tortoise TTS Apache 2.0 Неабходны
StyleTTS 2 MIT Неабавязковы
OpenVoice MIT Неабавязковы
Sesame CSM Apache 2.0 Неабходны
Orpheus Llama 3.2 "Built with Llama"
Spark TTS CC BY-NC-SA 4.0 Толькі асабістае і некамэрцыйнае выкарыстаньне Неабходны
OuteTTS CC BY-NC-SA 4.0 Толькі асабістае і некамэрцыйнае выкарыстаньне Неабходны

Самастойны хостынг супраць хоставанага API

Выканаць мадэлі самастойна або дазволіць нам кіраваць інфраструктурай

Самастойны вузел на вашым абсталяванні

Кожная мадэль на TTS.ai даступная як праект з адкрытым зыходным кодам на GitHub або Hugging Face. Сцягніце вагу, усталюйце залежнасці і запусціце вывад на вашых уласных GPU. Вы маеце поўны кантроль над латэнцыяй, прыватнасцю і масштабаваннем.

  • Поўная прыватнасьць дадзеных — гук ніколі не пакідае ваш сервер
  • Няма выдаткаў на запыт пасля першапачатковага настаўлення
  • Нестандартная дакладная наладка на вашых уласных дадзеных
  • Неабходны графічны працэсар (рэкамендуецца NVIDIA)
  • Вы кіруеце абнаўленнямі, масштабаваньнем і залежнасьцямі

Выкарыстоўваць хоставаны API TTS.ai

Атрымайце неадкладны доступ да ўсіх 20+ мадэляў праз адзін REST API. Мы займаемся прапарцыянаваннем GPU, абнаўленнямі мадэляў, кіраваннем чаргамі і масштабаваннем. Адзін ключ API дае вам доступ да кожнай мадэлі - няма неабходнасці кіраваць асобнымі разгортваннямі.

  • Аперацыйная сістэма не патрабуецца
  • Усе 20+ мадэляў праз адзін API
  • Аўтаматычнае абнаўленне і паляпшэнне мадэляў
  • 99. 9% час працы з рэзервовай інфраструктурай
  • Плаціце толькі за тое, чым карыстаецеся

Хуткае запуску: API або Self- Host

Выкарыстоўвайце наш хоставаны API або ўсталюйце Kokoro лакальна за некалькі хвілін

Варыянт 1: TTS.ai хоставаны API Самы лёгкі
import requests

response = requests.post("https://api.tts.ai/v1/tts", json={
    "text": "Open source TTS with a simple API.",
    "model": "kokoro",
    "voice": "af_heart",
    "format": "wav"
}, headers={"Authorization": "Bearer YOUR_API_KEY"})

with open("output.wav", "wb") as f:
    f.write(response.content)
Варыянт 2: самастойны вузел з pip Поўнае кіраванне
# Install Kokoro locally
pip install kokoro

# Generate speech on your own GPU
import kokoro

pipeline = kokoro.KPipeline(lang_code="a")
generator = pipeline("Hello from your own server!", voice="af_heart")
for i, (gs, ps, audio) in enumerate(generator):
    kokoro.save(audio, f"output_{i}.wav")

Адкрыты код, даступная цана

Нашы хоставаныя API робяць TTS з адкрытым зыходным кодам даступным без кіравання GPU.

Вольны пласт

$0

50 крэдытных пры рэгістрацыі

  • 4 свабодныя мадэлі з адкрытым зыходным кодам
  • Няма рэгістрацыі для простага выкарыстання
  • Асабістае, некамэрцыйнае выкарыстаньне

Старт

$9

500 кредитов/ месяц

  • Усе 20+ мадэляў з адкрытым зыходным кодам
  • Клонаванне голасу
  • Даступ да API

Прафесійны

$29

2000 кредитов/ месяц

  • Прыярытэтная апрацоўка GPU
  • Усе прэміум мадэлі
  • Падтрымка кампаніі
Паказаць поўную цану

Частыя пытанні

Частыя пытаньні пра адкрыты тэкставы працэсар

Yes, every model on TTS.ai is open source, and most use MIT or Apache 2.0. A few use other licenses, including some licensed for non-commercial use only, which are marked "Personal and non-commercial use only" in the voice picker. Each model page lists its license.

Абедзве ліцэнзіі адкрытага кода дазваляюць камерцыйнае выкарыстанне, змены і распаўсюджванне. Apache 2. 0 дадае выразныя патэнты і патрабуе паведамляць аб зменах, калі вы змяняеце код. MIT прасцей з меншымі патрабаваннямі. Абедзве зручныя для бізнесу.

Так. Кожная мадэль можа быць самастойнай. Клонаваць сховішча мадэлі з GitHub, усталяваць залежнасці, загрузіць вагі мадэлі і выканаць вывад. Мы прадастаўляем дакументацыю для патрабаванняў кожнай мадэлі да самастойнага хостынгу, уключаючы GPU, RAM і версію Python.

Неабходныя патрабаванні адрозніваюцца ў залежнасці ад мадэлі. Piper не патрабуе графічнага працэсара (толькі працэсар). Kokoro і MeloTTS патрабуюць 1-2 ГБ VRAM. Большасць стандартных мадэляў патрабуюць 4 ГБ VRAM. Tortoise і Sesame CSM патрабуюць 8 ГБ. NVIDIA RTX 3060 (12 ГБ) можа камфортна працаваць з большасцю мадэляў.

Так. Ліцэнзіі з адкрытым зыходным кодам дазваляюць змены, уключаючы дакладную наладку. Мадэлі, такія як GPT- SoVITS і Bark, даюць сцэнары дакладнай наладкі. Вы можаце трэніраваць мадэлі на вашых уласных галасавых дадзеных, каб стварыць уласныя галасы або палепшыць прадукцыйнасць для пэўных моў.

Лепшыя мадэлі з адкрытым зыходным кодам (Kokoro, StyleTTS 2, Chatterbox) цяпер адпавядаюць або пераўзыходзяць камерцыйныя сэрвісы, такія як ElevenLabs і Google TTS, па якасных паказчыках. Галоўнай перавагай камерцыйных сэрвісаў з'яўляецца кіруемая інфраструктура і падтрымка, а не якасць гуку.

Некаторыя былі выдаленыя: XTTS/XTTS-v2 (Coqui' s CPML, некамэрцыйны), F5-TTS (CC-BY-NC, некамэрцыйны) і Higgs-v2 (Bosonic License, restrictive). Некаторыя засталіся мадэлі і голасу, такія як Spark TTS, OuteTTS і большасць голасаў Piper, ліцэнзаваныя толькі для некамэрцыйнага выкарыстання; яны пазначаны "Personal and non-commercial use only" у выбарцы голасу, таму выкарыстоўвайце іншы голас для камерцыйных праектаў.

Так. Большасць мадэляў прымаюць дапамогу супольнасці праз GitHub. Вы можаце дасылаць паведамленні аб памылках, гукавыя запісы для новых моў, паляпшэнні коду і дакументацыю. Праверце рэпазітары GitHub кожнай мадэлі для правілаў удзелу і актыўных праблем.

Загрузіць мадэлі па патрабаванні і разгрузіць, калі яны не выкарыстоўваюцца, каб падзяліцца памяццю GPU. Наш сервер GPU запускае 20+ мадэляў на 4x Tesla P40 (96GB агульнай VRAM) з дынамічнай загрузкай. Для самаабслугоўвання адзін 24GB GPU можа абслугоўваць 3-5 мадэляў адначасова.

Многія мадэлі прадастаўляюць афіцыйныя Docker-образы або Dockerfiles. Для запуску некалькіх мадэляў вы можаце стварыць уласную наладу Docker з NVIDIA Container Toolkit для доступу да GPU. Наша архітэктура сервера API можа служыць рэферэнцыйнай рэалізацыяй.

Большасць мадэляў патрабуюць Python 3.10-3.12. Coqui TTS (VITS) патрабуе Python 3.11. Мы рэкамендуем Python 3.12 для большасці мадэляў. Праверце requirements.txt кожнай мадэлі для дакладнай сумяшчальнасці версій.

If you self-host, mostly yes: MIT and Apache 2.0 licenses explicitly allow commercial use, and most models here use them, so you can build SaaS products, mobile apps, games and services with no licensing fees or royalties. Check the license on each model page first, because a few models and voices are non-commercial. Audio generated on TTS.ai itself follows your plan: personal use on the free tier, commercial use on any paid plan.
5.0/5 (1)

Што мы можам палепшыць? Ваша ацэнка дапаможа нам выправіць праблемы.

Паспрабуйце Open Source TTS сёньня

20+ мадэляў з адкрытым зыходным кодам, кожная з іх з ліцэнзіяй. Выкарыстоўвайце наш API або self-host, выбар вашы.