Whisperでポッドキャストを文字起こしする
原文は Shawn Wang により に公開されました。 このブログを購読する
事前準備
一度だけやればいいセットアップ
brew install ffmpeg # takes a while!
git clone https://github.com/ggerganov/whisper.cpp
cd whisper.cpp
make
cd models
./download-ggml-model.sh base.en or ./download-ggml-model.sh medium.en # see full model list here https://github.com/ggerganov/whisper.cpp/tree/master/models手順
- 音声ファイルを16kHzの.wavファイルに変換する:
ffmpeg -i SOURCE_FILE.wav -ar 16000 output.wav - 次に、
whisper.cppディレクトリ内で./main -m models/ggml-medium.en.bin -f output.wav >> output.txtを実行する。文字起こし結果がoutput.txtに書き出される
- 入力約3分に対して文字起こしに約2分かかる(medium - 769Mパラメータモデルの場合)
- または、入力約12分に対して文字起こしに約1分かかる(base - 74Mパラメータモデルの場合)
記事をランダムに読む
コメント
ログインしてコメントする