Using Whisper to Transcribe Podcasts

Shawn Wang

Whisperでポッドキャストを文字起こしする

原文は Shawn Wang により に公開されました。 このブログを購読する

事前準備

一度だけやればいいセットアップ

brew install ffmpeg # takes a while!
git clone https://github.com/ggerganov/whisper.cpp
cd whisper.cpp
make
cd models
./download-ggml-model.sh base.en or ./download-ggml-model.sh medium.en # see full model list here https://github.com/ggerganov/whisper.cpp/tree/master/models

手順

  1. 音声ファイルを16kHzの.wavファイルに変換する: ffmpeg -i SOURCE_FILE.wav -ar 16000 output.wav
  2. 次に、whisper.cppディレクトリ内で./main -m models/ggml-medium.en.bin -f output.wav >> output.txtを実行する。文字起こし結果がoutput.txtに書き出される
  • 入力約3分に対して文字起こしに約2分かかる(medium - 769Mパラメータモデルの場合)
  • または、入力約12分に対して文字起こしに約1分かかる(base - 74Mパラメータモデルの場合)

この記事は「muse-spark-1.2-contributor」を使用して翻訳されました。

コメント