So transkribieren Sie Podcast-Audio (WhisperX mit Sprecher-Diarisierung)
Hinweis: Manchmal ist WhisperX WAAYYYY zu langsam, sodass ich oft https://github.com/ggerganov/whisper.cpp verwende, was irgendwie viel schneller läuft.
Ich arbeite viel an der Transkription von Podcasts und hatte heute wieder Bedarf daran. Die HuggingFace-Leerzeichen (wie dieses https://huggingface.co/spaces/vumichien/whisper-speaker-diarization) weisen immer einen Fehler auf und sind daher nicht sehr nützlich.
Das hat bei mir funktioniert.
Hinweis: Wenn Sie auf den Fehler „Neuer Fehler: ‚Soundfile‘-Backend ist nicht verfügbar“ stoßen,
conda install -c conda-forge libsndfilereparieren.
- Stellen Sie sicher, dass Sie das haben
.wavfür Ihr Podcast-Audio. Sie können Quicktime oder Audacity zum Konvertieren verwenden. Dieser Vorgang funktioniert nicht für MP3 pip3 install git+https://github.com/m-bain/whisperx.gitDies wird einige Minuten dauern. in der Zwischenzeit…- Lesen Sie https://github.com/m-bain/whisperX#voice-activity-detection-filtering – diarization. Um die VAD-Filterung und Diarisierung zu aktivieren, fügen Sie nach dem Argument „hf_token“ Ihr Hugging Face-Zugriffstoken ein, das Sie hier generieren können, und akzeptieren Sie die Benutzervereinbarung für die folgenden Modelle: Segmentierung, Sprachaktivitätserkennung (VAD) und Sprecher-Diarisierung. Stellen Sie sicher, dass Sie sie alle in Ihrem Huggingface-Konto akzeptieren.
whisperx YOUR_AUDIO_FILE.wav --hf_token YOUR_HF_TOKEN_HERE --vad_filter --diarize --min_speakers 3 --max_speakers 3 --language enfür 3 Sprecher in Englisch. Denken Sie daran, dass es sich um eine WAV-Datei handeln muss.

Das Transkribieren dauert etwa 30 Sekunden. Seien Sie also darauf vorbereitet, dass das Transkribieren die Zeit Ihres Audio-Podcasts in Anspruch nimmt.

