Using Whisper to Transcribe Podcasts

Shawn Wang

Whisper로 팟캐스트 전사하기

원문은 Shawn Wang님이 에 게재했습니다. 이 블로그 구독하기

사전 준비

한 번만 설정하면 되는 것들

brew install ffmpeg # takes a while!
git clone https://github.com/ggerganov/whisper.cpp
cd whisper.cpp
make
cd models
./download-ggml-model.sh base.en or ./download-ggml-model.sh medium.en # see full model list here https://github.com/ggerganov/whisper.cpp/tree/master/models

단계

  1. 오디오 파일을 16kHz .wav 파일로 변환합니다: ffmpeg -i SOURCE_FILE.wav -ar 16000 output.wav
  2. 그런 다음 whisper.cpp 디렉터리에서 ./main -m models/ggml-medium.en.bin -f output.wav >> output.txt를 실행하면 전사 결과가 output.txt로 저장됩니다
  • 약 3분 분량의 입력은 전사하는 데 약 2분이 걸립니다 (medium - 769M 파라미터 모델 기준)
  • 또는 약 12분 분량의 입력은 전사하는 데 약 1분이 걸립니다 (base - 74M 파라미터 모델 기준)

이 글은 muse-spark-1.2-contributor 모델을 사용해 번역했습니다.

댓글