バグ/機能要求を報告

オープンソーステキスト・トゥ・スピーチモデル

私たちのプラットフォーム上のすべての TTS モデルはオープンソースであり、ほとんどは MIT または Apache 2.0 を使用しています。少数のモデルと音声は非商用のみライセンスされており、「個人的で非商用のみ」とマークされています。私たちのホスト API を通して使用するか、完全なコントロールの下で自分のインフラストラクチャ上で自分でホストすることができます。

オープンソース MITライセンス アパッチ2.0 セルフホスタブル GitHub

トライ・イット・ナウ

無料でココロ、パイパー、VITS、メロTTS
生成されたオーディオはここに表示されます
生成
0:00
TTS.aiが気に入りましたか?友達に教えてあげましょう!

オープンソースTTS

オープンソースモデルがプロジェクトに重要な理由

全てオープンソースライセンス

TTS.ai のすべてのモデルはオープンソースであり、すべてのモデルページはライセンスをリストしています。専有ブラックボックスやベンダーロックインはありません。

オープンソースライセンス

ほとんどのモデルは MIT または Apache 2.0 のライセンスで提供されています。他のライセンスを使用するモデルも少なくありません。非商用のモデルや音声は「個人的・非商用のみ」とマークされています。

セルフホスタブル

任意のモデルをダウンロードして、自分のハードウェアで実行します。データ、遅延、インフラストラクチャを完全にコントロールできます。クラウド依存性は必要ありません。

GPU 最適化

モデルはCUDAサポートのNVIDIA GPUに最適化されています。PiperはCPUのみで動作します。効率的な推論にはほとんどのモデルで2-8GBのVRAMが必要です。

コミュニティ管理

活発なオープンソースコミュニティがこれらのモデルを維持し、改善しています。GitHubにバグ、改善、新しい声を提出することで、貢献を歓迎しています。

商用ライセンスが利用可能

月額5ドルからの有料プランは、ロイヤリティや使用料がかかりません。フリープランは個人用です。「個人用および非商用用途のみ」とマークされたモデルや音声は除外されます。

オープンソースモデルカタログ

それぞれのモデル、ライセンス、 それが最も得意なこと

KokoroKokoro

Free

Lightweight 82M parameter model delivering studio-quality speech with blazing-fast inference.

ファスト 5/5

適応する: Apache 2.0 - 最高品質のフリーモデル、82Mパラメータ、簡単なセルフホスティング

試してみる Kokoro

PiperPiper

Free

A fast, local neural text to speech system optimized for Raspberry Pi and embedded devices.

ファスト 3/5

適応する: MIT — CPU のみ、エッジデバイスや組み込みセルフホスティングに適している

試してみる Piper

VITSVITS

Free

Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech.

ファスト 3/5

適応する: MIT — 多くのダウンストリームモデルで使われている基礎アーキテクチャ

試してみる VITS

BarkBark

Standard

Transformer-based text-to-audio model that generates realistic speech, music, and sound effects.

スロー 4/5

適応する: MIT — 標準のTTSを超えるユニークなオーディオ生成能力

試してみる Bark

Tortoise TTSTortoise TTS

Premium

Multi-voice text-to-speech focused on quality with autoregressive architecture.

スロー 5/5 音声クローン

適応する: Apache 2.0 - 最高品質、広く研究された参照実装

試してみる Tortoise TTS

OpenVoiceOpenVoice

Premium

Instant voice cloning with granular control over style, emotion, and accent.

メディア 4/5 音声クローン

適応する: MIT — 粒状スタイル制御を備えたオープンソースの音声クローン

試してみる OpenVoice

オープンソース TTS の使い方

ホストされた API を使うか、自分でモデルを実行します

1

オープンソースモデルを探索

20以上のオープンソース TTS モデルのカタログをブラウズしてください。各モデルページはライセンス、アーキテクチャ、機能、セルフホスティング要件を示しています。

2

ブラウザで試してみる

何もインストールせずに TTS.ai 上で直接どんなモデルでもテストできます。私たちの GPU サーバが処理を行うので、セルフホスティングに取り組む前に品質を評価できます。

3

自己ホストか、我々の API を使用

GitHub からモデルリポジトリをクローンしてローカルで実行するか、プロダクション用にホストされた API を使用します。セルフホスティングは完全なコントロールを与え、我々の API は管理されたインフラストラクチャを提供します。

4

アプリケーションを作成

自己ホストモデルまたはREST APIを使って、TTSをプロダクトに統合します。 まず、モデルごとのライセンスを確認してください。 いくつかのモデルと音声は非商用のみです。

ライセンス比較

各モデルのライセンスはTTS.ai

モデル ライセンス 商用利用 修正 セルフホスト 著作権
Kokoro Apache 2.0 必須
Piper MIT 音声ライセンスは異なります 一部の声だけ オプション
VITS MIT オプション
MeloTTS MIT オプション
Chatterbox MIT オプション
Tortoise TTS Apache 2.0 必須
StyleTTS 2 MIT オプション
OpenVoice MIT オプション
Sesame CSM Apache 2.0 必須
Orpheus Llama 3.2 "Built with Llama"
Spark TTS CC BY-NC-SA 4.0 個人非商用のみ 必須
OuteTTS CC BY-NC-SA 4.0 個人非商用のみ 必須

セルフホスティングとホストAPI

自分でモデルを実行するか、インフラストラクチャを我々に任せるか

自分のハードウェアでセルフホスト

TTS.ai のすべてのモデルは GitHub または Hugging Face でオープンソースプロジェクトとして利用できます。重みをダウンロードし、依存関係をインストールし、自分の GPU で推論を実行します。遅延、プライバシー、スケーリングを完全にコントロールできます。

  • 完全なデータプライバシー — オーディオはサーバを離れません
  • 初期設定後はリクエスト当たりのコストはありません
  • 自分のデータをカスタムフィット
  • GPU ハードウェアが必要 (NVIDIA を推奨)
  • 更新、スケールアップ、依存関係の管理

TTS.ai ホスト API を使う

REST APIを使って20以上のモデルに即座にアクセスできます。GPUプロビジョニング、モデル更新、キュー管理、スケーリングを行います。1つのAPIキーで全てのモデルにアクセスできます。別々のデプロイメントを管理する必要はありません。

  • GPU ハードウェアが必要ありません
  • 1つのAPIを通して20以上のモデルを全てサポート
  • 自動モデル更新と改善
  • 冗長インフラで99.9%の稼働率
  • 使用分だけ支払う

クイックスタート: API またはセルフホスト

私たちのホストAPIを使用するか、Kokoroをローカルに数分でインストールします

選択肢 1: TTS.ai ホスト API 最も簡単
import requests

response = requests.post("https://api.tts.ai/v1/tts", json={
    "text": "Open source TTS with a simple API.",
    "model": "kokoro",
    "voice": "af_heart",
    "format": "wav"
}, headers={"Authorization": "Bearer YOUR_API_KEY"})

with open("output.wav", "wb") as f:
    f.write(response.content)
オプション 2: pip でセルフホスト フルコントロール
# Install Kokoro locally
pip install kokoro

# Generate speech on your own GPU
import kokoro

pipeline = kokoro.KPipeline(lang_code="a")
generator = pipeline("Hello from your own server!", voice="af_heart")
for i, (gs, ps, audio) in enumerate(generator):
    kokoro.save(audio, f"output_{i}.wav")

オープンソースで安価

これらのAPIは,GPUを管理することなくオープンソースのTTSをアクセスできるようにする。

フリー・タイア

$0

登録で50クレジット

  • 4つのオープンソースモデルがフリーで
  • 基本的な使用にはサインしない
  • 個人的な非商用利用

スター

$9

500クレジット/月

  • すべての20+オープンソースモデル
  • 声のクローン
  • APIアクセス

プロ

$29

月間200万文字

  • 優先GPU処理
  • プレミアムモデル
  • エンタープライズサポート
価格を見る

よくある質問

オープンソースのテキスト・トゥ・スピーチに関するよくある質問

はい、TTS.ai 上のすべてのモデルはオープンソースで、ほとんどは MIT または Apache 2.0 を使用しています。他のライセンスを使用しているものも少なくありません。非商用のみのライセンスを使用しているものもあります。これらは音声選択器に「個人用および非商用のみ」とマークされています。各モデルページにはライセンスが表示されています。

両方とも商用利用、修正、再配布を許容するオープンソースライセンスです。Apache 2.0は明示的な特許権を追加し、コードを修正するときは変更を明示する必要があります。MITは要求が少なく、単純です。両方ともビジネスに適しています。

はい。すべてのモデルは自己ホスト可能です。GitHubからモデルリポジトリをクローンし、依存関係をインストールし、モデル重みをダウンロードし、推論を実行します。GPU、RAM、Pythonバージョンを含む各モデルの自己ホスト要求事項に関するドキュメントを提供しています。

必要条件はモデルによって異なります。PiperはGPUを必要としません(CPUのみ)。KokoroとMeloTTSは1-2GBのVRAMを必要とします。ほとんどの標準モデルは4GBのVRAMを必要とします。TortoiseとSesame CSMは8GBを必要とします。NVIDIA RTX 3060 (12GB) はほとんどのモデルで快適に動作します。

はい。オープンソースライセンスは微調整を含む修正を許可します。GPT-SoVITS や Bark のようなモデルは微調整スクリプトを提供します。自分の音声データでモデルを訓練してカスタム音声を作成したり、特定の言語のパフォーマンスを向上させることができます。

オープンソースのトップモデル(Kokoro,StyleTTS2,Chatterbox)は,品質ベンチマークにおいて,ElevenLabsやGoogleのような商用TTSサービスと同等あるいはそれを上回っている。

XTTS/XTTS-v2 (Coqui's CPML, non-commercial)、F5-TTS (CC-BY-NC, non-commercial)、Higgs-v2 (Boson License, restrictive) などの一部は削除されています。Spark TTS、OuteTTS、およびほとんどの Piper 音声のような少数のモデルと音声は、非商用のみライセンスされています。これらは音声ピックアップで「個人用および非商用のみ」とマークされています。商用プロジェクトの場合は、別の音声を使用してください。

はい。ほとんどのモデルは GitHub を通じてコミュニティの貢献を受け入れます。バグレポート、新しい言語の音声録音、コードの改善、ドキュメントを提出できます。各モデルの GitHub リポジトリをチェックして、貢献のガイドラインと活動中の問題を確認してください。

GPU メモリを共有するために、要求に応じてモデルをロードし、無効になったときにロードを解除します。我々の GPU サーバはダイナミックローディングを使用して 4x Tesla P40 (総 VRAM 96GB) 上で 20 以上のモデルを実行します。セルフホスティングの場合、1 つの 24GB GPU は 3-5 モデルを同時にサービスできます。

多くのモデルは公式の Docker イメージまたは Dockファイルを提供しています。複数のモデルを実行する場合は、GPUアクセスのための NVIDIA Container Toolkit でカスタム Docker 設定を作成できます。APIサーバアーキテクチャは参照実装として役立ちます。

ほとんどのモデルは Python 3.10-3.12 を必要とします。Coqui TTS (VITS) は特に Python 3.11 を必要とします。ほとんどのモデルには Python 3.12 を推奨します。正確なバージョン互換性については、各モデルの requirements.txt を確認してください。

MIT と Apache 2.0 ライセンスは商用利用を明示的に許可しており、ここで使用されているモデルの多くはこれらを使用しています。それゆえ、ライセンス料やロイヤリティなしに SaaS 製品、モバイルアプリケーション、ゲーム、サービスを作成できます。モデルページのライセンスを確認してください。なぜなら、いくつかのモデルと音声は非商用です。TTS.ai で生成された音声は、あなたのプランに従います。フリープランでは個人用、有料プランでは商用用です。
5.0/5 (1)

改善点は何ですか?フィードバックは問題を解決するのに役立ちます。

オープンソース TTS を今すぐ試してみてください

20以上のオープンソースモデル、それぞれライセンスが表示されています。APIを使用したり、セルフホストしたり、あなたが選ぶことです。