Mai mulți vorbitori 2
Identificarea vorbitorilor diferiți dintr-un singur fișier audio se numește diarizare a vorbitorilor. Totuși, funcția gratuită pe care am folosit-o, recognize_google(), nu poate transcrie vorbitori separați.
O soluție pentru aceasta, fără a apela la serviciile plătite de conversie speech-to-text, este să te asiguri că fișierele tale audio conțin un singur vorbitor.
Așadar, dacă lucrezi cu date din apeluri telefonice, înregistrezi apelantul și receptorul separat. Astfel, poți transcrie fiecare fișier individual.
În acest exercițiu, vom transcrie fiecare vorbitor din fișierul audio cu mai mulți vorbitori în mod individual.
Acest exercițiu face parte din cursul
Procesarea limbajului vorbit în Python
Instrucțiuni pentru exercițiu
- Transmite
speakersfuncțieienumerate()pentru a itera prin vorbitorii diferiți. - Apelează
record()perecognizerpentru a convertiAudioFile-urile înAudioData. - Folosește
recognize_google()pentru a transcrie fiecare obiectspeaker_audio.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
recognizer = sr.Recognizer()
# Multiple speakers on different files
speakers = [sr.AudioFile("speaker_0.wav"),
sr.AudioFile("speaker_1.wav"),
sr.AudioFile("speaker_2.wav")]
# Transcribe each speaker individually
for i, speaker in enumerate(____):
with speaker as source:
speaker_audio = recognizer.____(source)
print(f"Text from speaker {i}:")
print(recognizer.____(____,
language="en-US"))