TTS-WebUIのインストール方法

image

今TTS動かせるUIいろいろ試してて、AIに出してもらった候補にTTS-WebUIがあったので触ってみました。

今後使うかわかんないんですが、一応インストールまでやったので手順だけまとめておきます。

TTS-WebUIとは?

※AI要約

TTS-WebUIは、複数の音声生成・音声処理モデルをまとめて扱えるローカル向けのWebUIです。

READMEだと、GradioバックエンドとReact UIを備えた構成が案内されており、インストーラー起動、手動セットアップ、Docker実行にも対応。

対応範囲はTTSにとどまらず、音楽生成や音声変換・補助ツールまで含まれており、必要なモデルは拡張機能として追加導入する方式。

さらに、SillyTavernやOpenWebUI向けのOpenAI互換TTS API連携も案内されており、ローカル音声基盤として幅広く使える設計になっています。

・主な特徴

  • 複数のTTSモデルをまとめて扱える統合UI
  • Bark、Tortoise、StyleTTS2、XTTSv2、F5-TTS、GPT-SoVITS、Piper など幅広い対応
  • 音楽生成やRVC、Whisper、Demucsなど音声関連ツールも扱える
  • 拡張機能方式で追加モデルを導入できる
  • インストーラー、手動セットアップ、Docker実行に対応
  • Gradio UIとReact UIの両方を利用可能
  • OpenAI互換TTS APIとして動かし、SillyTavernやOpenWebUIと連携できる
  • 拡張マーケットプレイスや拡張管理機能がある

github:https://github.com/rsxdalv/TTS-WebUI/tree/main

TTS-WebUIのインストール

インストーラー

githubの latest version リンクからzipをダウンロードできます。

image

任意の場所で解凍し、start_tts_webui.batを実行します。

image

進めていいか確認されるので y を入力して enter。

image

そうするとmicromambaというのを使って tts-webui-installer\installer_files\env に必要なパッケージなどがインストールされるようです。

途中でWebUIが開きますが、ターミナル側でGPU/CPUの選択肢が表示されます。

環境に合うものを選んでEnterで進めます。

image

終わるとこんな画面がブラウザで開くので、これでインストール完了です。

・React UI

image

・Gradio

image

手動

readmeに書いてある通りですが、手動の場合は事前に以下が必要です。

あとはコマンドでインストールしていきます。

・クローン

git clone https://github.com/rsxdalv/TTS-WebUI.git
cd TTS-WebUI

・仮想環境作成&アクティベート

python -m venv venv
venv/scirpts/activate

・依存関係インストール

pip install -r requirements.txt

・torch系インストール ※manual_installationのコマンドが対応してなかったので2.7.0+cu128にしてます。

pip install -U torch==2.7.0+cu128 torchvision torchaudio --index-url https://download.pytorch.org/whl/cu128

・起動

python server.py --no-react --no-database

ブラウザで以下が表示されればインストール完了です。

二回目も仮想環境アクティベートとして起動コマンドで開けます。

image

・オプション

React UI使う場合はNode.jsインストールしてから以下のコマンドを実行します。

powershellだと&&がエラーだったのでcmdの方が良さげです。

cd react-ui && npm install && npm run build

Databaseのセットアップ。

node installer_scripts/js/applyDatabaseConfig.js

あとは引数なしで実行すれば起動できます。

python server.py
image

Gradioをバックエンドで動かしているので、Gradioが起動してないとReact側は使えません。

Gradio が動いていればどっちでも使えるんですが、よく分かんねって人はGradio直接操作の方がやりやすいかもです。

TTS-WebUIの基本の使い方

とりあえずTTSだけ試します。

Gradio

仕様したいモデルをタブから選びます。

モデルによっては拡張機能のインストールが必要です。

image

一番左上のVall-E-Xというのを使ってみました。

textに作成したい文章を入力してGenerateで生成できます。

image

Language・Accent・Modeで調整できるみたいです。

image

結果:

モデルのloadなしだと15秒の音声が21秒で生成できました。

output

React UI

上で書いた通りGradioがバックエンドなので、使いたいモデルは先にGradio側でインストールしておく必要があります。

またインストール後は再起動が必要です。

リスタートみたいな機能はない?ようなので手動で再起動してください。

あとKokoro試したら足りないパッケージとかMeCabのエラーとかでうまく動かせなかったので、Gradioと同じVALL-E Xで試してます。

React UI側で使いたいモデルを選び、Runをクリックします。

image

生成したいテキストを入力します。

image

Languageなどを設定します。

image

あとはGenerateで生成可能です。

image

最後だけなんか分けわかんなくなってますが、一応生成できました。

output2

まとめ

モデルが予め用意されているので、とりあえずいろんなTTSモデルを触ってみたいって言う人には便利だと思います。

ただそれ以外の任意のモデルは動かせない?ようです。

なので生成したいモデルがある場合は対応してるか、事前に調べた方がいいかもしれません。

他にもACESTEP使えたり、RVC使えたり機能は豊富なので、音声あれこれしたい人には合うと思います。

以上TTS-WebUIの使い方を紹介しました。

タイトルとURLをコピーしました