Modele otwartego tekstu źródłowego do mowy

Każdy model TTS na naszej platformie jest otwartym źródłem, a większość używa MIT lub Apache 2.0. Kilka modeli i głosy są licencjonowane tylko do użytku niekomercyjnego i są oznaczone "wyłącznie użytkowanie osobowe i niekomercyjne". Użyj ich za pośrednictwem naszego hostowanego API lub samorządzający je w swojej infrastrukturze z pełną kontrolą.

Otwarte źródło Licencja MIT Apache 2.0 Właściwość GitHub

Spróbuj teraz

Darmowe z Kokoro, Piper, VITS, Melotts
Wygenerowany dźwięk pojawi się tutaj
Zbudowany
0:00
Pobierz
Powiedz znajomym!

Korzyści z otwartego źródła TTS

Dlaczego modele open-source mają znaczenie dla twoich projektów

Wszystkie otwarte źródła licencjonowane

Każdy model na TTS.ai jest otwartym źródłem, a każda strona modelu zawiera swoją licencję. Żadnych zastrzeżonych czarnych skrzynek i żadnych zamykań.

Licencje otwartego źródła

Większość modeli jest licencjonowana pod MIT lub Apache 2.0. Kilka innych licencji, a modele lub głosy licencjonowane do niekomercyjnego użytku są oznaczone "wyłącznie użytkowanie osobowe i niekomercyjne".

Właściwość

Pobierz dowolny model i uruchomić go na własny sprzęt. Pełna kontrola nad danymi, latencją i infrastrukturą. Nie wymaga się chmury zależności.

Zoptymalizowany GPU

Modele są zoptymalizowane dla GPU NVIDIA z obsługą CUDA. Piper działa tylko na procesorze. Większość modeli wymaga 2-8GB VRAM do efektywnych wyników.

Wspólnota utrzymywana

Aktywne społeczności otwarte utrzymują i ulepszają te modele. Wkłady powitane — przekazywanie błędów, ulepszenia i nowych głosów na GitHub.

Licencja handlowa dostępna

Plan płatniczy od $5/mo posiada licencję handlową za to, co generujesz, bez opłat licencyjnych lub opłat za korzystanie z opłat; bezpłatny poziom jest przeznaczony do użytku osobistego. Modele i głosy oznaczone "wyłącznie użytkowanie osobowe i niekomercyjne" są wyłączone.

Nasz katalog modelu Open Source

Każdy model, jego licencja, i to, co robi najlepiej

KokoroKokoro

Free

Lightweight 82M parameter model delivering studio-quality speech with blazing-fast inference.

Szybko 5/5

Najlepsze dla: Apache 2.0 – najlepszy model bez jakości, 82M params, łatwy do samoporządkowania

Spróbuj. Kokoro

PiperPiper

Free

A fast, local neural text to speech system optimized for Raspberry Pi and embedded devices.

Szybko 3/5

Najlepsze dla: MIT – tylko procesor, idealny dla urządzeń krawędziowych i wbudowanych samoprzyrządów

Spróbuj. Piper

VITSVITS

Free

Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech.

Szybko 3/5

Najlepsze dla: MIT – architektura fundamentalna używana przez wiele modeli poniżej

Spróbuj. VITS

BarkBark

Standard

Transformer-based text-to-audio model that generates realistic speech, music, and sound effects.

Powoli 4/5

Najlepsze dla: MIT – niepowtarzalne możliwości wytwarzania dźwięku poza standardową TTS

Spróbuj. Bark

Tortoise TTSTortoise TTS

Premium

Multi-voice text-to-speech focused on quality with autoregressive architecture.

Powoli 5/5 Klonowanie głosu

Najlepsze dla: Apache 2.0 – maksymalna jakość, szeroko badane wdrażanie odniesienia

Spróbuj. Tortoise TTS

OpenVoiceOpenVoice

Premium

Instant voice cloning with granular control over style, emotion, and accent.

Średni 4/5 Klonowanie głosu

Najlepsze dla: MIT – klonowanie głosu z otwartym źródłem z granularną kontrolą stylu

Spróbuj. OpenVoice

Jak korzystać z otwartego źródła TTS

Użyj naszych hosted API lub uruchomi modele samodzielnie

1

Poznaj modele otwartego źródła

Przeglądaj nasz katalog modeli 20+ otwartego źródła TTS. Każda strona modelowa przedstawia licencję, architekturę, możliwości i wymagania samodzielnego hostingu.

2

Spróbuj w swojej przeglądarce

Testuj dowolny model bezpośrednio na TTS.ai bez instalacji nic. Nasze serwery GPU obsługują przetwarzanie, aby można ocenić jakość przed zaangażowaniem się w samo-hosting.

3

Właściwość lub korzystanie z naszego API

Repos modelu klonowego z GitHub i uruchomić lokalnie, lub użyć naszego hostowanego API do produkcji. Samodomowca daje pełną kontrolę; nasz API zapewnia zarządzaną infrastrukturę.

4

Zbuduj aplikację

Iнтегрuj TTS do swojego produktu przy użyciu modeli samorządzonych lub naszego REST API. Sprawdź najpierw każdą licencję modelu: kilka modeli i głosów jest tylko dla niekomercyjnych zastosowań.

Porównanie licencji

Licencja każdego modelu na TTS.ai

Wzór Licencja Stosowanie handlowe Zmiana Właściwość Attribucja
Kokoro Apache 2.0 Wymagane
Piper MIT silnik; licencje głosowe różnią się Tylko niektóre głosy Opcjonalnie
VITS MIT Opcjonalnie
MeloTTS MIT Opcjonalnie
Chatterbox MIT Opcjonalnie
Tortoise TTS Apache 2.0 Wymagane
StyleTTS 2 MIT Opcjonalnie
OpenVoice MIT Opcjonalnie
Sesame CSM Apache 2.0 Wymagane
Orpheus Llama 3.2 "Built with Llama"
Spark TTS CC BY-NC-SA 4.0 Wyłącznie użytkowanie osobowe i niehandlowe Wymagane
OuteTTS CC BY-NC-SA 4.0 Wyłącznie użytkowanie osobowe i niehandlowe Wymagane

Samoprzygotowanie ws hosted API

Uruchom modele sami lub pozwól nam zarządzać infrastrukturą

Właściwość na Twoim sprzętie

Każdy model na TTS.ai jest dostępny jako projekt open-source na GitHub lub Hugging Face. Pobierz wagi, zainstaluj zależności i uruchomij inferencję na własnych GPU. Masz pełną kontrolę nad latencją, prywatnością i skalowaniem.

  • Pełna prywatność danych — audio nigdy nie opuszcza serwera
  • Brak kosztów na żądanie po początkowym ustawieniu
  • Właściwe dostosowywanie do własnych danych
  • Wymaga sprzętu GPU (zalecana NVIDIA)
  • Zarządzasz aktualizacjami, skalowaniem i zależnościami

Użyj TTS.ai hosted API

Otrzymamy natychmiastowy dostęp do wszystkich modeli 20+ poprzez pojedynczy REST API. Zajmujemy się dostarczaniem GPU, aktualizacjami modeli, zarządzaniem kolejką i skalowaniem. Jeden klucz API daje dostęp do każdego modelu – nie ma potrzeby do zarządzania oddzielnym rozmieszczeniem.

  • Brak sprzętu GPU
  • Wszystkie modele 20+ przez jeden API
  • Automatyczne aktualizacje i ulepszenia modeli
  • 99,9% przerwy na zbędną infrastrukturę
  • Zapłać tylko za to, co użyjesz

Szybki rozpoczątek: API lub samoprzybycie

Użyj naszego hosted API, lub zainstaluj Kokoro lokalnie w minutach

Wariant 1: TTS.ai Hosted API Najłatwiejsze
import requests

response = requests.post("https://api.tts.ai/v1/tts", json={
    "text": "Open source TTS with a simple API.",
    "model": "kokoro",
    "voice": "af_heart",
    "format": "wav"
}, headers={"Authorization": "Bearer YOUR_API_KEY"})

with open("output.wav", "wb") as f:
    f.write(response.content)
Wariant 2: Samodzielność z pip Pełna kontrola
# Install Kokoro locally
pip install kokoro

# Generate speech on your own GPU
import kokoro

pipeline = kokoro.KPipeline(lang_code="a")
generator = pipeline("Hello from your own server!", voice="af_heart")
for i, (gs, ps, audio) in enumerate(generator):
    kokoro.save(audio, f"output_{i}.wav")

Otwarte źródło, dostępne ceny

Nasz hosted API sprawia, że otwarte źródło TTS jest dostępne bez zarządzania GPU.

Wolny poziom

$0

15 kredytów na zarejestrowanie

  • 4 modele open-source za darmo
  • Brak rejestracji dla podstawowego użytku
  • Osobowe, niehandlowe zastosowanie

Rozpoczynacz

$9

500 000 znaków/miesiąc

  • Wszystkie modele 20+ open-source
  • Klonowanie głosu
  • Dostęp API

Prof.

$29

2 000 000 znaków/miesiąc

  • Priorytet przetwarzania GPU
  • Wszystkie modele premium
  • Wsparcie dla przedsiębiorstw
Wyświetl pełne ceny

Często zadawane pytania

Wspólne pytania dotyczące tekstu otwartego źródła do wypowiedzi

Tak, każdy model na TTS.ai jest otwartym źródłem, a większość używa MIT lub Apache 2.0. Kilka innych licencji, w tym niektóre licencje tylko do użytku niehandlowego, które są oznaczone "wyłącznie indywidualne i niekomercyjne" w pikaczu głosowym. Każda strona modelu wymienia swoją licencję.

Obydwa są licencjami otwartego źródła pozwalającymi na użytkowanie handlowe, modyfikację i redystrybucję. Apache 2.0 dodaje wyraźne dotacje patentowe i wymaga określenia zmian w przypadku modyfikacji kodu. MIT jest prostsza z mniej wymagań. Obie są przyjazne dla biznesu.

Tak. Każdy model może być samodomówiony. Klonuj repozytorium modelu z GitHub, zainstaluj zależności, pobierz wagi modelu i uruchomij wynik. Zapewniamy dokumentację dla wymagań samodomowców każdego modelu, w tym wersji GPU, RAM i Python.

Wymagania różnią się w zależności od modelu. Piper nie potrzebuje tylko GPU (tylko CPU). Kokoro i Melotts potrzebują 1-2GB VRAM. Większość standardowych modeli wymaga 4GB VRAM. Tortoise i Sesame CSM potrzebują 8GB. NVIDIA RTX 3060 (12GB) może uruchomić większość modeli komfortowo.

Tak. Licencje otwartego źródła pozwalają na modyfikację, włącznie z dostosowywaniem. Modele takie jak GPT-SoviTS i Bark zapewniają skrypty. Można trenować modele na własnych danych głosowych, aby utworzyć własne głosy lub poprawić wydajność dla konkretnych języków.

Najlepsze modele open-source (Kokoro, StyleTTS 2, Chatterbox) teraz pasują lub przekraczają usługi komercyjne takie jak 11Labs i Google TTS w odniesieniu do jakości. Główną zaletą usług komercyjnych jest zarządzanie infrastrukturą i wsparciem, a nie jakość dźwięku.

Niektóre zostały usunięte: XTTS/XTS-v2 (COPML Coqui's, niekomercyjne), F5-TTS (CC-BY-NC, niekomercyjne) i Higgs-v2 (Licencja Boson, restrykcyjna). Kilka pozostałych modeli i głosów, takich jak Spark TTS, Outetts i większości głosów Piper, są licencjonowane wyłącznie do niekomercyjnych zastosowań; są one oznaczone "wyłącznie indywidualne i niekomercyjne" w pikerzerze głosowym, więc używają innego głosu dla projektów komercyjnych.

Tak. Większość modeli akceptuje składki społeczności za pośrednictwem GitHub. Możesz przekazywać raporty o błędach, nagrania głosowe dla nowych języków, poprawy kodu i dokumentację. Sprawdź repozytorium GitHub każdego modelu w celu uzyskania wytycznych dotyczących wkładów i aktywnych problemów.

Wczytaj modele na żądanie i wyładuj przy dzieleniu się pamięcią GPU. Nasz serwer GPU obsługuje modele 20+ na 4x Tesla P40 (96GB totalny VRAM) przy użyciu dynamicznego załadunku. Dla samo-hostingu, jeden 24GB GPU może jednocześnie obsługiwać modele 3-5.

Wiele modeli zapewnia oficjalne obrazy Docker lub Dockerfiles. Dla uruchomienia wielu modeli, można zbudować własny konfiguracja Docker z NVIDIA Container Toolkit dla dostępu do GPU. Nasza architektura serwera API może służyć jako implementacja referencyjna.

Większość modeli wymaga Python 3.10-3.12. Coqui TTS (VITS) wymaga specjalnie Python 3.11. Zalecamy Python 3.12 dla większości modeli. Sprawdź wymagania każdego modelu.txt o dokładną kompatybilność wersji.

Jeśli jesteś samorządcą, głównie tak: licencje MIT i Apache 2.0 wyraźnie pozwalają na użytek komercyjny, a większość modeli tutaj używa ich, więc możesz budować produkty SaaS, aplikacje mobilne, gry i usługi bez opłat licencyjnych lub rola licencji. Sprawdź licencję na każdej stronie modelu, ponieważ kilka modeli i głosów są niekomercyjne. Wytwarzany na TTS.ai sam plan: osobiste wykorzystanie na szczeblach, użytkowanie handlowe na każdej opłaconej stronie.
5.0/5 (1)

Co moglibyśmy ulepszyć? Twoje zwroty zwrotne pomagają nam rozwiązać problemy.

Spróbuj Open Source TTS Dzisiaj

20+ modele open-source, każdy z wyszczególnionych licencji. Użyj naszego API lub samo-domowca, wybór jest twój.