
今TTS動かせるUIいろいろ試してて、AIに出してもらった候補にTTS-WebUIがあったので触ってみました。
今後使うかわかんないんですが、一応インストールまでやったので手順だけまとめておきます。
TTS-WebUIとは?
※AI要約
TTS-WebUIは、複数の音声生成・音声処理モデルをまとめて扱えるローカル向けのWebUIです。
READMEだと、GradioバックエンドとReact UIを備えた構成が案内されており、インストーラー起動、手動セットアップ、Docker実行にも対応。
対応範囲はTTSにとどまらず、音楽生成や音声変換・補助ツールまで含まれており、必要なモデルは拡張機能として追加導入する方式。
さらに、SillyTavernやOpenWebUI向けのOpenAI互換TTS API連携も案内されており、ローカル音声基盤として幅広く使える設計になっています。
・主な特徴
- 複数のTTSモデルをまとめて扱える統合UI
- Bark、Tortoise、StyleTTS2、XTTSv2、F5-TTS、GPT-SoVITS、Piper など幅広い対応
- 音楽生成やRVC、Whisper、Demucsなど音声関連ツールも扱える
- 拡張機能方式で追加モデルを導入できる
- インストーラー、手動セットアップ、Docker実行に対応
- Gradio UIとReact UIの両方を利用可能
- OpenAI互換TTS APIとして動かし、SillyTavernやOpenWebUIと連携できる
- 拡張マーケットプレイスや拡張管理機能がある
github:https://github.com/rsxdalv/TTS-WebUI/tree/main
TTS-WebUIのインストール
インストーラー
githubの latest version リンクからzipをダウンロードできます。

任意の場所で解凍し、start_tts_webui.batを実行します。

進めていいか確認されるので y を入力して enter。

そうするとmicromambaというのを使って tts-webui-installer\installer_files\env に必要なパッケージなどがインストールされるようです。
途中でWebUIが開きますが、ターミナル側でGPU/CPUの選択肢が表示されます。
環境に合うものを選んでEnterで進めます。

終わるとこんな画面がブラウザで開くので、これでインストール完了です。
・React UI

・Gradio

手動
readmeに書いてある通りですが、手動の場合は事前に以下が必要です。
あとはコマンドでインストールしていきます。
・クローン
git clone https://github.com/rsxdalv/TTS-WebUI.git
cd TTS-WebUI・仮想環境作成&アクティベート
python -m venv venv
venv/scirpts/activate・依存関係インストール
pip install -r requirements.txt・torch系インストール ※manual_installationのコマンドが対応してなかったので2.7.0+cu128にしてます。
pip install -U torch==2.7.0+cu128 torchvision torchaudio --index-url https://download.pytorch.org/whl/cu128・起動
python server.py --no-react --no-databaseブラウザで以下が表示されればインストール完了です。
二回目も仮想環境アクティベートとして起動コマンドで開けます。

・オプション
React UI使う場合はNode.jsインストールしてから以下のコマンドを実行します。
powershellだと&&がエラーだったのでcmdの方が良さげです。
cd react-ui && npm install && npm run buildDatabaseのセットアップ。
node installer_scripts/js/applyDatabaseConfig.jsあとは引数なしで実行すれば起動できます。
python server.py
Gradioをバックエンドで動かしているので、Gradioが起動してないとReact側は使えません。
Gradio が動いていればどっちでも使えるんですが、よく分かんねって人はGradio直接操作の方がやりやすいかもです。
TTS-WebUIの基本の使い方
とりあえずTTSだけ試します。
Gradio
仕様したいモデルをタブから選びます。
モデルによっては拡張機能のインストールが必要です。

一番左上のVall-E-Xというのを使ってみました。
textに作成したい文章を入力してGenerateで生成できます。

Language・Accent・Modeで調整できるみたいです。

結果:
モデルのloadなしだと15秒の音声が21秒で生成できました。
output
React UI
上で書いた通りGradioがバックエンドなので、使いたいモデルは先にGradio側でインストールしておく必要があります。
またインストール後は再起動が必要です。
リスタートみたいな機能はない?ようなので手動で再起動してください。
あとKokoro試したら足りないパッケージとかMeCabのエラーとかでうまく動かせなかったので、Gradioと同じVALL-E Xで試してます。
React UI側で使いたいモデルを選び、Runをクリックします。

生成したいテキストを入力します。

Languageなどを設定します。

あとはGenerateで生成可能です。

最後だけなんか分けわかんなくなってますが、一応生成できました。
output2
まとめ
モデルが予め用意されているので、とりあえずいろんなTTSモデルを触ってみたいって言う人には便利だと思います。
ただそれ以外の任意のモデルは動かせない?ようです。
なので生成したいモデルがある場合は対応してるか、事前に調べた方がいいかもしれません。
他にもACESTEP使えたり、RVC使えたり機能は豊富なので、音声あれこれしたい人には合うと思います。
以上TTS-WebUIの使い方を紹介しました。

