Comece agoraComece grátis

Vários locutores 2

Distinguir vários locutores em um único arquivo de áudio é chamado de diarização de locutor (speaker diarization). No entanto, você viu que a função gratuita que estamos usando, recognize_google(), não consegue transcrever locutores diferentes.

Uma forma de contornar isso, sem usar um dos serviços pagos de fala para texto, é garantir que seus arquivos de áudio tenham apenas um locutor.

Isso significa que, se você estivesse trabalhando com dados de chamadas telefônicas, garantiria que quem liga e quem atende fossem gravados separadamente. Assim, você poderia transcrever cada arquivo individualmente.

Neste exercício, vamos transcrever cada um dos locutores do nosso arquivo de áudio com vários locutores individualmente.

Este exercicio faz parte do curso

Processamento de Linguagem Falada em Python

Ver curso

Instruções do exercicio

  • Passe speakers para a função enumerate() para iterar pelos diferentes locutores.
  • Chame record() em recognizer para converter os AudioFiles em AudioData.
  • Use recognize_google() para transcrever cada um dos objetos speaker_audio.

exercicio interativo prático

Tente este exercicio completando este código de exemplo.

recognizer = sr.Recognizer()

# Multiple speakers on different files
speakers = [sr.AudioFile("speaker_0.wav"), 
            sr.AudioFile("speaker_1.wav"), 
            sr.AudioFile("speaker_2.wav")]

# Transcribe each speaker individually
for i, speaker in enumerate(____):
    with speaker as source:
        speaker_audio = recognizer.____(source)
    print(f"Text from speaker {i}:")
    print(recognizer.____(____,
         				  language="en-US"))
Editar e Executar Código