Modelos de texto a voz de código aberto

Every TTS model on our platform is open source, and most use MIT or Apache 2.0. A few models and voices are licensed for non-commercial use only and are marked 'Personal and non-commercial use only'. Use them through our hosted API, or self-host them on your own infrastructure with full control.

Código aberto Licenza MIT Apache Autoservible GitHub

Probalo agora

Libre con Kokoro, Piper, VITS, MeloTTS
O son xerado aparecerá aquí
Xerado
0:00
Obter
Encántalle TTS.ai? Cóntallo aos teus amigos!

Vantaxes do TTS de código aberto

Por que os modelos de código aberto son importantes para os seus proxectos

Todos con licenza de código aberto

Cada modelo en TTS.ai é de código aberto, e cada páxina de modelo lista a súa licenza. Non hai caixas negras propietarias nin bloqueos de vendedores.

Licenzas de código aberto

Most models are licensed under MIT or Apache 2.0. A few use other licenses, and models or voices licensed for non-commercial use are marked "Personal and non-commercial use only".

Autoservible

Obteña calquera modelo e executeo no seu propio hardware. Control total sobre os seus datos, latencia e infraestrutura. Non require dependencia da nube.

Optimizado para GPU

Os modelos están optimizados para GPU NVIDIA con soporte CUDA. Piper só se executa na CPU. A maioría dos modelos precisan de 2 a 8 GB de VRAM para unha inferencia eficiente.

Mantida pola comunidade

Comunidades activas de código aberto manteñen e melloran estes modelos. As contribucións son benvidas: envíe erros, melloras e novas voces en GitHub.

Dispoñíbel licenza comercial

Un plan de pago de $5/ mes leva a licenza comercial para o que xera, sen royalties nin taxas de uso; o nivel gratuíto é para uso persoal. Exclúense os modelos e voces marcados como « Só uso persoal e non comercial ».

O noso catálogo de modelos de código aberto

Cada modelo, a súa licenza e o que mellor fai

KokoroKokoro

Free

Lightweight 82M parameter model delivering studio-quality speech with blazing-fast inference.

Rápido 5/5

Mellor para: Apache 2. 0 - modelo libre de mellor calidade, 82M parámetros, fácil de auto- aloxar

Probar Kokoro

PiperPiper

Free

A fast, local neural text to speech system optimized for Raspberry Pi and embedded devices.

Rápido 3/5

Mellor para: MIT — só CPU, perfecto para dispositivos periféricos e autoaloxamento incorporado

Probar Piper

VITSVITS

Free

Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech.

Rápido 3/5

Mellor para: MIT — arquitectura fundamental usada por moitos modelos subseguintes

Probar VITS

BarkBark

Standard

Transformer-based text-to-audio model that generates realistic speech, music, and sound effects.

Lento 4/5

Mellor para: MIT — capacidades únicas de xeración de son máis alá do TTS estándar

Probar Bark

Tortoise TTSTortoise TTS

Premium

Multi-voice text-to-speech focused on quality with autoregressive architecture.

Lento 5/5 Clonaxe de voz

Mellor para: Apache 2. 0 - máxima calidade, implementación de referencia amplamente estudada

Probar Tortoise TTS

OpenVoiceOpenVoice

Premium

Instant voice cloning with granular control over style, emotion, and accent.

Medio 4/5 Clonaxe de voz

Mellor para: MIT — clonación de voz de código aberto con control de estilo granular

Probar OpenVoice

Como usar TTS de código aberto

Empregue a nosa API aloxada ou execute modelos vostede mesmo

1

Explore modelos de código aberto

Examine o noso catálogo de máis de 20 modelos de TTS de código aberto. Cada páxina de modelo mostra a licenzarquitectura, as capacidades e os requisitos de autoaloxamento.

2

Probar no navegador

Probe calquera modelo directamente en TTS.ai sen instalar nada. Os nosos servidores de GPU xestionan o procesamento para que poida avaliar a calidade antes de comprometerse co autoaloxamento.

3

Autoaloxamento ou usar a nosa API

Clone repositorios de modelos desde GitHub e execute localmente, ou empregue a nosa API aloxada para produción. O autoaloxamento dá control total; a nosa API proporciona infraestrutura xestionada.

4

Cree o seu propio programa

Integre TTS no seu produto empregando modelos autoaloxados ou a nosa API REST. Comprobe primeiro a licenza de cada modelo: algúns modelos e voces son só para uso non comercial.

Comparación de licenzas

Licenza de cada modelo en TTS.ai

Modelo Licenza Uso comercial Modificación Servidor automático Atribución
Kokoro Apache 2.0 Requirido
Piper MIT motor; as licenzas de voz varían Só algunhas voces Opcional
VITS MIT Opcional
MeloTTS MIT Opcional
Chatterbox MIT Opcional
Tortoise TTS Apache 2.0 Requirido
StyleTTS 2 MIT Opcional
OpenVoice MIT Opcional
Sesame CSM Apache 2.0 Requirido
Orpheus Llama 3.2 "Built with Llama"
Spark TTS CC BY-NC-SA 4.0 Só uso persoal e non comercial Requirido
OuteTTS CC BY-NC-SA 4.0 Só uso persoal e non comercial Requirido

Autoaloxamento vs API aloxada

Execute os modelos vostede mesmo ou deixe que nos encarguemos da infraestrutura

Autoservizo no hardware

Cada modelo de TTS.ai está dispoñíbel como proxecto de código aberto en GitHub ou Hugging Face. Descargue os pesos, instale as dependencias e execute a inferencia nas súas propias GPU. Ten control total sobre a latencia, a privacidade e o escalado.

  • Privacidade completa dos datos: o son nunca sae do servidor
  • Sen custos por petición despois da configuración inicial
  • Afinación personalizada dos seus propios datos
  • Require hardware de GPU (recoméndase NVIDIA)
  • Xestione actualizacións, escalado e dependencias

Empregar a API aloxada de TTS.ai

Obteña acceso instantáneo a máis de 20 modelos a través dunha única API REST. Xestionamos o aprovisionamento da GPU, as actualizacións de modelos, a xestión de filas e o escalado. Unha chave de API dá acceso a todos os modelos, sen necesidade de xestionar implementacións separadas.

  • Non se precisa hardware de GPU
  • Máis de 20 modelos a través dunha API
  • Actualizacións e melloras automáticas do modelo
  • Tempo de actividade do 99,9% con infraestrutura redundante
  • Pague só polo que use

Inicio rápido: API ou autoservizo

Empregue a nosa API aloxada ou instale Kokoro localmente en minutos

Opción 1: API aloxada por TTS.ai O máis sinxelo
import requests

response = requests.post("https://api.tts.ai/v1/tts", json={
    "text": "Open source TTS with a simple API.",
    "model": "kokoro",
    "voice": "af_heart",
    "format": "wav"
}, headers={"Authorization": "Bearer YOUR_API_KEY"})

with open("output.wav", "wb") as f:
    f.write(response.content)
Opción 2: Autoservizo con pip Control total
# Install Kokoro locally
pip install kokoro

# Generate speech on your own GPU
import kokoro

pipeline = kokoro.KPipeline(lang_code="a")
generator = pipeline("Hello from your own server!", voice="af_heart")
for i, (gs, ps, audio) in enumerate(generator):
    kokoro.save(audio, f"output_{i}.wav")

Código aberto, prezos asequibles

A nosa API aloxada fai accesible o TTS de código aberto sen xestionar GPUs.

Nivel libre

$0

15. 000 caracteres ao rexistrarse

  • 4 modelos de código aberto gratuítos
  • Non hai rexistro para o uso básico
  • Uso persoal e non comercial

Iniciador

$9

500 créditos/mes

  • Todos os 20+ modelos de código aberto
  • Clonaxe de voz
  • Acceso á API

Pro

$29

2000 créditos/mes

  • Prioridade no procesamento da GPU
  • Todos os modelos premium
  • Soporte empresarial
Ver o prezo completo

Preguntas frecuentes

Preguntas frecuentes sobre a síntese de voz de código aberto

Yes, every model on TTS.ai is open source, and most use MIT or Apache 2.0. A few use other licenses, including some licensed for non-commercial use only, which are marked "Personal and non-commercial use only" in the voice picker. Each model page lists its license.

Ambas son licenzas permisivas de código aberto que permiten o uso comercial, modificación e redistribución. Apache 2. 0 engade concesións explícitas de patentes e require indicar os cambios se se modifica o código. MIT é máis sinxelo con menos requisitos. Ambas son amigables para os negocios.

Si. Cada modelo pode ser autoaloxado. Clone o repositorio do modelo desde GitHub, instale as dependencias, descargue os pesos do modelo e execute a inferencia. Proporcionamos documentación para os requisitos de autoaloxamento de cada modelo, incluíndo GPU, RAM e versión de Python.

Os requisitos varían segundo o modelo. Piper non precisa GPU (só CPU). Kokoro e MeloTTS precisan 1- 2 GB de VRAM. A maioría dos modelos estándar precisan 4 GB de VRAM. Tortoise e Sesame CSM precisan 8 GB. Unha NVIDIA RTX 3060 (12 GB) pode executar a maioría dos modelos con comodidade.

Si. As licenzas de código aberto permiten a modificación, incluíndo o axuste fino. Modelos como GPT- SoVITS e Bark fornecen scripts de axuste fino. Pode adestrar modelos cos seus propios datos de voz para crear voces personalizadas ou mellorar o rendemento para linguaxes específicas.

Os mellores modelos de código aberto (Kokoro, StyleTTS 2, Chatterbox) agora igualan ou superan os servizos comerciais como ElevenLabs e Google TTS nos parámetros de calidade. A principal vantaxe dos servizos comerciais é a infraestrutura xestionada e o soporte, non a calidade do son.

Elimináronse algunhas: XTTS/ XTTS- v2 (CPML de Coqui, non comercial), F5- TTS (CC- BY- NC, non comercial) e Higgs- v2 (Licenza de Bosón, restritiva). Algúns modelos e voces restantes, como Spark TTS, OuteTTS e a maioría das voces de Piper, están licenciados só para uso non comercial; están marcados como « Só uso persoal e non comercial » no selector de voces, polo que use unha voz diferente para proxectos comerciais.

Si. A maioría dos modelos aceptan contribucións da comunidade a través de GitHub. Pode enviar informes de erros, gravacións de voz para novas linguaxes, melloras de código e documentación. Comprobe o repositorio de GitHub de cada modelo para as directrices de contribución e problemas activos.

Cargue modelos segundo a demanda e descargue cando estea inactivo para compartir a memoria da GPU. O noso servidor de GPU executa máis de 20 modelos en 4x Tesla P40 (96 GB de VRAM total) usando carga dinámica. Para autoaloxamento, unha única GPU de 24 GB pode servir de 3 a 5 modelos simultaneamente.

Moitos modelos fornecen imaxes oficiais de Docker ou ficheiros Dockerfiles. Para executar varios modelos, pode construír unha configuración personalizada de Docker con NVIDIA Container Toolkit para o acceso á GPU. A nosa arquitectura de servidor API pode servir como implementación de referencia.

A maioría dos modelos requiren Python 3. 10- 3. 12. Coqui TTS (VITS) precisa especificamente Python 3. 11. Recoméndase Python 3. 12 para a maioría dos modelos. Comprobe o requirements. txt de cada modelo para a compatibilidade exacta da versión.

If you self-host, mostly yes: MIT and Apache 2.0 licenses explicitly allow commercial use, and most models here use them, so you can build SaaS products, mobile apps, games and services with no licensing fees or royalties. Check the license on each model page first, because a few models and voices are non-commercial. Audio generated on TTS.ai itself follows your plan: personal use on the free tier, commercial use on any paid plan.
5.0/5 (1)

Que podemos mellorar? Os seus comentarios axúdannos a corrixir os problemas.

Probe hoxe o TTS de código aberto

Máis de 20 modelos de código aberto, cada un coa súa licenza listada. Use a nosa API ou auto-host, a elección é súa.