
以前からこのnoteでもwhisperはちょいちょい紹介しているのですが、基本pythonコードで動かしており、自分だとうまく設定できない部分がありました。
YMM4とか代替案はあるのですが、YMM4も保存できるのはsrtのみなので少し処理が限定的です。
で、先日GIGAZINEの記事で「vibe」というツールが紹介されていました。
無料・オフラインで音声・動画を文字として書き起こす「Vibe」、OpenAIのWhisperを使ってWindows・macOS・Linuxで動作可能でYouTubeにも対応 – GIGAZINE
実際に触ってみたらこれが結構使いやすかったので、今回はこの「Vibe」を紹介します。
Vibeとは?
ローカルで動かせるWhisperベースの音声文字起こしツールです。
GUIで操作可能かつシンプルな作りになっており、誰でも簡単に使えます。
CLI・APIも搭載されているため、用途に応じて柔軟に使えるそうです。
・主な特徴まとめ
- 完全オフライン動作(プライバシー重視)
- Whisper使用(OpenAI製)
- 音声・動画ファイルの文字起こし(マイク・システム音声対応)
- 多言語対応/英語翻訳オプションあり
- バッチ処理対応
- 出力形式:TXT, SRT, VTT, HTML, PDF, JSON, DOCX など
- リアルタイムプレビュー付き
- 要約機能:Claude API または Ollama によるローカル要約対応
- YouTube等のURL指定で文字起こし可能
- CLI・HTTP API対応(–server オプションあり)
- GPU最適化済み(Nvidia, AMD, Intel)
- キャプションの長さ調整オプションあり
- スピーカー識別(話者分離)対応
- iOS/Android版も今後提供予定
github:thewh1teagle/vibe: Transcribe on your own!
Vibeのインストール
以下のリンクからDownload For Windowsをクリックします。

githubのリリースページから「vibe_3.0.5_x64-setup.exe」をダウンロードしてもOKです。
インストーラーが保存されるので、起動して案内に沿ってセットアップしてください。
基本デフォルトのまま進めて問題ありません
インストールが終わると以下の画面になるのでFinishをクリックすればvibeが起動します。
ショートカット要らない人はチェック外してください。

Vibeの使い方
Vibeを起動するとこんな画面が表示されます。

アイコンは処理する音声の種類、Languageは何語で文字起こしするかです。
- マイク:自分の音声
- フォルダ:ローカルファイル
- リンク:YouTube
マイクで文字起こし
マイクアイコンをクリックするとこんな画面になります。

入力先とスピーカーを選択してrecord and transcribeをクリック。
そうすると録音が始まります。

この状態で喋ると、stop押すまでの音声が文字起こしされます。

文字起こししたものはコピーしたり、右上で形式を変えて保存したり、自分の用途に合わせて変更できます。
これは後述するローカルやYouTubeの文字起こしでも同じです。
ローカルファイルの文字起こし
フォルダアイコンを開いて、select fileから文字起こししたいファイルを選択します。

後はtranscribeで実行。

この動画はChatGPTに考えてもらった以下の文章をずんだもんに読ませたものです。
句読点はないですが、誤字脱字なく文字起こしできていました。
※ChatGPTの出力
YouTubeの文字起こし
リンクアイコンをクリックしてYouTubeのURLを入力すると、その動画の文字起こしができます。
例)https://www.youtube.com/shorts/9LSAAHOrUtY
実行すると音声のみダウンロードして、その動画を文字起こしをしてくれます。

音声データはtempフォルダに保存されます。
一時データなのでクリーンアップとかのときに削除できますが、長い動画を何回も処理する場合は手動で削除した方が節約できるかもしれません。
C:\Users\user_name\AppData\Local\Temp\vibe_temp_YYYY-MM-DDなお、デフォルトでバージョン確認がONになってるのでアップデートを求めらたら、そのままUpdate nowをクリックしてください。
settingからオフも可能ですが基本アップデート推奨です。

CLIで使う
Vibeはコマンドラインからも操作可能です。
パス移動が面倒なので最初にパス通しとくと楽です。
Windows検索→システム環境変数→環境変数を開き、path→編集→新規から以下を追加してください。
C:\Users\user_name\AppData\Local\vibeこれでCLIからvibeが使えるようになります。
基本はインプット、フォーマット、アウトプット、モデル、Language辺りを指定するだけです。
実行場所によってはインプットやモデルはフルパスで指定する必要があります。
もしくはモデルのパスにインプットデータなどをまとめておくと短いコマンドで実行できます。
例
--file test.mp4 --format txt --write test.txt -m ggml-large-v3-turbo.bin -l japanese無事実行できるとこんな感じです。

使える引数はvibe –helpで確認できます。
モデルの切り替え
文字起こしに使用するモデルを任意のものにできます。
タイトル左にある三点リーダーからsettingへ。

Customizeのところからモデルの設定ができます。

Paste Model LinkにhuggingfaceのURLを入力して矢印をクリックすると直接ダウンロードが可能です。
例)

一覧から選びたい場合は、Downloads Modelsを開いてくださ。
ブラウザでモデル一覧が表示されるので使いたいモデルをダウンロードします。
Magic setupだとVibeで使用するフォルダに直接保存、Directだとブラウザの設定に従ってダウンロードされます。

デフォルトのモデル置き場は以下のパスです。
C:\Users\user_name\AppData\Local\github.com.thewh1teagle.vibeChange Moldes Folderで変更もできます。
感想
まず導入や操作が簡単なので誰でも使いやすいと思います。
起こしたデータのフォーマットをその場で切り替えられるのも意外と便利。
字幕用(srt)とか、記事用の資料(txt)とかプルダウンで切り替えられるのは実用的に感じました。
あとpythonだと長い動画を処理したときにうまく文字起こしできないことがありました。
多分設定すればうまくできると思うのですが、自分だとあまりわからず…。
Vibeはデフォルトでそういった対応できているのか、二時間くらいの音声も問題なかったです。
自分でうまく環境構築できなかった人や、シンプルなGUIで文字起こししたいって人には便利なツールだと思います。
興味ある方はぜひ試してみてください。
以上Vibeの使い方をご紹介しました。

