How to transcribe podcast audio (WhisperX with speaker diarization)

Shawn Wang

ポッドキャスト音声を文字起こしする方法(WhisperXと話者ダイアライゼーション)

原文は Shawn Wang により に公開されました。 このブログを購読する

注:WhisperXはときどきめちゃくちゃ遅いので、結局https://github.com/ggerganov/whisper.cppを使うことが多い。なぜかこちらの方がはるかに速く動く。

普段からポッドキャストの文字起こしをよくやっていて、今日もまた必要になった。Hugging Face Spaces(例えばhttps://huggingface.co/spaces/vumichien/whisper-speaker-diarizationのようなもの)は毎回エラーになるので、あまり役に立たない。

自分で試してうまくいったのはこれだ。

注:New error: 'soundfile' backend is not available errorというエラーが出た場合は、conda install -c conda-forge libsndfileで直せる。

  1. ポッドキャスト音声の.wavを用意すること。変換にはQuickTimeやAudacityが使える。この処理はmp3では動かない。
  2. pip3 install git+https://github.com/m-bain/whisperx.gitを実行する。数分かかる。その間に……
  3. https://github.com/m-bain/whisperX#voice-activity-detection-filtering--diarizationを読むこと。VADフィルタリングとダイアライゼーションを有効にするには、--hf_token引数の後にこちらで生成できるHugging Faceのアクセストークンを指定し、以下のモデルの利用規約に同意する必要がある:SegmentationVoice Activity Detection (VAD)、そしてSpeaker Diarization。Hugging Faceアカウントですべてに同意しておくこと。
  4. whisperx YOUR_AUDIO_FILE.wav --hf_token YOUR_HF_TOKEN_HERE --vad_filter --diarize --min_speakers 3 --max_speakers 3 --language en 英語で話者が3人の場合。必ず.wavファイルであることを忘れないように。

画像

30秒の音声を文字起こしするのに約30秒かかるので、ポッドキャスト自体と同じくらいの時間がかかると思っておいた方がいい。

画像

この記事は「muse-spark-1.2-contributor」を使用して翻訳されました。

コメント