多位說話者 1
如果你的目標是轉錄對話,通常會有多位說話者。不過,如你將看到的,recognize_google() 函式只會把語音轉成一整段文字。
你可以在【這個音訊檔】(https://assets.datacamp.com/production/repositories/4637/datasets/925c8c31d6e4af9c291c692f13e4f41c7b5e86b2/multiple-speakers-16k.wav) 中聽到有 3 位不同的說話者。
但如果只用它來轉錄,recognize_google() 會回傳單一整塊的文字。這依然有用,但你無法知道是哪位說話者說了哪些內容。
我們會在下一個練習看到另一種作法。
多位說話者的音訊檔已匯入並轉換為 AudioData,變數名稱為 multiple_speakers。
本練習屬於課程
Python 的口語語言處理
練習說明
- 建立一個
Recognizer的實例。 - 使用
recognize_google()函式辨識變數multiple_speakers。 - 將語言設定為美式英文(
"en-US")。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create a recognizer class
recognizer = sr.____()
# Recognize the multiple speaker AudioData
text = recognizer.recognize_google(____,
language=____)
# Print the text
print(text)