Whisperが簡単に使える「Vibe」が便利

image

以前からこのnoteでもwhisperはちょいちょい紹介しているのですが、基本pythonコードで動かしており、自分だとうまく設定できない部分がありました。

YMM4とか代替案はあるのですが、YMM4も保存できるのはsrtのみなので少し処理が限定的です。

で、先日GIGAZINEの記事で「vibe」というツールが紹介されていました。

無料・オフラインで音声・動画を文字として書き起こす「Vibe」、OpenAIのWhisperを使ってWindows・macOS・Linuxで動作可能でYouTubeにも対応 – GIGAZINE

実際に触ってみたらこれが結構使いやすかったので、今回はこの「Vibe」を紹介します。

Vibeとは?

ローカルで動かせるWhisperベースの音声文字起こしツールです。

GUIで操作可能かつシンプルな作りになっており、誰でも簡単に使えます。

CLI・APIも搭載されているため、用途に応じて柔軟に使えるそうです。

・主な特徴まとめ

  • 完全オフライン動作(プライバシー重視)
  • Whisper使用(OpenAI製)
  • 音声・動画ファイルの文字起こし(マイク・システム音声対応)
  • 多言語対応/英語翻訳オプションあり
  • バッチ処理対応
  • 出力形式:TXT, SRT, VTT, HTML, PDF, JSON, DOCX など
  • リアルタイムプレビュー付き
  • 要約機能:Claude API または Ollama によるローカル要約対応
  • YouTube等のURL指定で文字起こし可能
  • CLI・HTTP API対応(–server オプションあり)
  • GPU最適化済み(Nvidia, AMD, Intel)
  • キャプションの長さ調整オプションあり
  • スピーカー識別(話者分離)対応
  • iOS/Android版も今後提供予定

github:thewh1teagle/vibe: Transcribe on your own!

Vibeのインストール

以下のリンクからDownload For Windowsをクリックします。

image

Vibe.

githubのリリースページから「vibe_3.0.5_x64-setup.exe」をダウンロードしてもOKです。

Releases · thewh1teagle/vibe

インストーラーが保存されるので、起動して案内に沿ってセットアップしてください。

基本デフォルトのまま進めて問題ありません

インストールが終わると以下の画面になるのでFinishをクリックすればvibeが起動します。

ショートカット要らない人はチェック外してください。

image

Vibeの使い方

Vibeを起動するとこんな画面が表示されます。

image

アイコンは処理する音声の種類、Languageは何語で文字起こしするかです。

  • マイク:自分の音声
  • フォルダ:ローカルファイル
  • リンク:YouTube

マイクで文字起こし

マイクアイコンをクリックするとこんな画面になります。

image

入力先とスピーカーを選択してrecord and transcribeをクリック。

そうすると録音が始まります。

image

この状態で喋ると、stop押すまでの音声が文字起こしされます。

image

文字起こししたものはコピーしたり、右上で形式を変えて保存したり、自分の用途に合わせて変更できます。

これは後述するローカルやYouTubeの文字起こしでも同じです。

ローカルファイルの文字起こし

フォルダアイコンを開いて、select fileから文字起こししたいファイルを選択します。

image

後はtranscribeで実行。

image

この動画はChatGPTに考えてもらった以下の文章をずんだもんに読ませたものです。

句読点はないですが、誤字脱字なく文字起こしできていました。

※ChatGPTの出力

YouTubeの文字起こし

リンクアイコンをクリックしてYouTubeのURLを入力すると、その動画の文字起こしができます。

例)https://www.youtube.com/shorts/9LSAAHOrUtY

実行すると音声のみダウンロードして、その動画を文字起こしをしてくれます。

image

音声データはtempフォルダに保存されます。

一時データなのでクリーンアップとかのときに削除できますが、長い動画を何回も処理する場合は手動で削除した方が節約できるかもしれません。

C:\Users\user_name\AppData\Local\Temp\vibe_temp_YYYY-MM-DD

なお、デフォルトでバージョン確認がONになってるのでアップデートを求めらたら、そのままUpdate nowをクリックしてください。

settingからオフも可能ですが基本アップデート推奨です。

image

CLIで使う

Vibeはコマンドラインからも操作可能です。

パス移動が面倒なので最初にパス通しとくと楽です。

Windows検索→システム環境変数→環境変数を開き、path→編集→新規から以下を追加してください。

C:\Users\user_name\AppData\Local\vibe

これでCLIからvibeが使えるようになります。

基本はインプット、フォーマット、アウトプット、モデル、Language辺りを指定するだけです。

実行場所によってはインプットやモデルはフルパスで指定する必要があります。

もしくはモデルのパスにインプットデータなどをまとめておくと短いコマンドで実行できます。

例
--file test.mp4 --format txt --write test.txt -m ggml-large-v3-turbo.bin -l japanese

無事実行できるとこんな感じです。

image

使える引数はvibe –helpで確認できます。

モデルの切り替え

文字起こしに使用するモデルを任意のものにできます。

タイトル左にある三点リーダーからsettingへ。

image

Customizeのところからモデルの設定ができます。

image

Paste Model LinkにhuggingfaceのURLを入力して矢印をクリックすると直接ダウンロードが可能です。

例)

model.safetensors ?? openai/whisper-large-v3-turbo at main
We???re on a journey to advance and democratize artificial intelligence through open source and open science.

一覧から選びたい場合は、Downloads Modelsを開いてくださ。

ブラウザでモデル一覧が表示されるので使いたいモデルをダウンロードします。

Magic setupだとVibeで使用するフォルダに直接保存、Directだとブラウザの設定に従ってダウンロードされます。

image

デフォルトのモデル置き場は以下のパスです。

C:\Users\user_name\AppData\Local\github.com.thewh1teagle.vibe

Change Moldes Folderで変更もできます。

感想

まず導入や操作が簡単なので誰でも使いやすいと思います。

起こしたデータのフォーマットをその場で切り替えられるのも意外と便利。

字幕用(srt)とか、記事用の資料(txt)とかプルダウンで切り替えられるのは実用的に感じました。

あとpythonだと長い動画を処理したときにうまく文字起こしできないことがありました。

多分設定すればうまくできると思うのですが、自分だとあまりわからず…。

Vibeはデフォルトでそういった対応できているのか、二時間くらいの音声も問題なかったです。

自分でうまく環境構築できなかった人や、シンプルなGUIで文字起こししたいって人には便利なツールだと思います。

興味ある方はぜひ試してみてください。

以上Vibeの使い方をご紹介しました。

タイトルとURLをコピーしました