팟캐스트 오디오를 전사하는 방법 (WhisperX로 화자 분리하기)
원문은 Shawn Wang님이 에 게재했습니다. 이 블로그 구독하기
참고: WhisperX는 가끔 WAAYYYY 너무 느려서 결국 https://github.com/ggerganov/whisper.cpp를 쓰게 되는데, 이게 어떻게든 훨씬 더 빠르게 동작한다.
팟캐스트 전사 작업을 많이 하는데 오늘 또 할 일이 생겼다. Hugging Face Space(예: https://huggingface.co/spaces/vumichien/whisper-speaker-diarization 같은 것)는 항상 오류가 나서 별로 쓸모가 없다.
나에게 제대로 동작한 방법은 이거다.
참고: New error: 'soundfile' backend is not available error 오류가 발생하면,
conda install -c conda-forge libsndfile로 해결하면 된다.
- 팟캐스트 오디오의
.wav파일을 준비한다. quicktime이나 audacity로 변환하면 된다. 이 과정은 mp3에서는 동작하지 않는다. pip3 install git+https://github.com/m-bain/whisperx.git몇 분 정도 걸린다. 그동안...- https://github.com/m-bain/whisperX#voice-activity-detection-filtering--diarization을 읽어본다. VAD 필터링과 Diarization을 활성화하려면 --hf_token 인수 뒤에 여기에서 생성할 수 있는 Hugging Face 액세스 토큰을 넣고, 다음 모델들의 사용자 약관에 동의해야 한다: Segmentation , Voice Activity Detection (VAD) 및 Speaker Diarization. Hugging Face 계정에서 모두 동의했는지 확인한다.
whisperx YOUR_AUDIO_FILE.wav --hf_token YOUR_HF_TOKEN_HERE --vad_filter --diarize --min_speakers 3 --max_speakers 3 --language en영어로 화자가 3명인 경우다. 반드시.wav파일이어야 한다.

30초 분량을 전사하는 데 30초 정도 걸리니, 팟캐스트 오디오 길이만큼 시간이 걸린다고 생각하면 된다.

글을 무작위로 읽기
댓글
로그인하고 댓글 남기기