ÎncepețiÎncepe gratuit

Mai mulți vorbitori 2

Identificarea vorbitorilor diferiți dintr-un singur fișier audio se numește diarizare a vorbitorilor. Totuși, funcția gratuită pe care am folosit-o, recognize_google(), nu poate transcrie vorbitori separați.

O soluție pentru aceasta, fără a apela la serviciile plătite de conversie speech-to-text, este să te asiguri că fișierele tale audio conțin un singur vorbitor.

Așadar, dacă lucrezi cu date din apeluri telefonice, înregistrezi apelantul și receptorul separat. Astfel, poți transcrie fiecare fișier individual.

În acest exercițiu, vom transcrie fiecare vorbitor din fișierul audio cu mai mulți vorbitori în mod individual.

Acest exercițiu face parte din cursul

Procesarea limbajului vorbit în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Transmite speakers funcției enumerate() pentru a itera prin vorbitorii diferiți.
  • Apelează record() pe recognizer pentru a converti AudioFile-urile în AudioData.
  • Folosește recognize_google() pentru a transcrie fiecare obiect speaker_audio.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

recognizer = sr.Recognizer()

# Multiple speakers on different files
speakers = [sr.AudioFile("speaker_0.wav"), 
            sr.AudioFile("speaker_1.wav"), 
            sr.AudioFile("speaker_2.wav")]

# Transcribe each speaker individually
for i, speaker in enumerate(____):
    with speaker as source:
        speaker_audio = recognizer.____(source)
    print(f"Text from speaker {i}:")
    print(recognizer.____(____,
         				  language="en-US"))
Editează și rulează codul