開始使用免費開始

多位說話者 1

如果你的目標是轉錄對話,通常會有多位說話者。不過,如你將看到的,recognize_google() 函式只會把語音轉成一整段文字。

你可以在【這個音訊檔】(https://assets.datacamp.com/production/repositories/4637/datasets/925c8c31d6e4af9c291c692f13e4f41c7b5e86b2/multiple-speakers-16k.wav) 中聽到有 3 位不同的說話者。

但如果只用它來轉錄,recognize_google() 會回傳單一整塊的文字。這依然有用,但你無法知道是哪位說話者說了哪些內容。

我們會在下一個練習看到另一種作法。

多位說話者的音訊檔已匯入並轉換為 AudioData,變數名稱為 multiple_speakers

本練習屬於課程

Python 的口語語言處理

檢視課程

練習說明

  • 建立一個 Recognizer 的實例。
  • 使用 recognize_google() 函式辨識變數 multiple_speakers
  • 將語言設定為美式英文("en-US")。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Create a recognizer class
recognizer = sr.____()

# Recognize the multiple speaker AudioData
text = recognizer.recognize_google(____, 
                       			   language=____)

# Print the text
print(text)
編輯並執行程式碼