np.frombuffer() 的 dtype 預設為 float。若要將聲波位元組視覺化,正確的 dtype 應該設定為什麼?
np.frombuffer()
dtype
你可以執行 np.frombuffer(signal_gm, dtype=____) 嘗試不同的選項。
np.frombuffer(signal_gm, dtype=____)
本練習屬於課程
將理論付諸實踐,立即體驗我們的互動練習
音訊檔和多數其他型態的資料不同。在開始處理之前,需要先做一些前處理。本章中,你會學到處理語音檔的第一步:將兩個不同的音訊檔轉成聲波,並在視覺上加以比較。
當前練習
語音辨識距離完美仍有一段距離。不過,SpeechRecognition 函式庫可讓你輕鬆與多種語音轉文字 API 互動。本節會帶你使用 SpeechRecognition 函式庫,快速把音訊檔中的口語內容轉成文字。
並非所有音訊檔都有相同的形狀、大小或格式。所幸,James Robert 開發的 PyDub 函式庫提供多種工具,讓你以程式方式調整音訊屬性,如取樣率、聲道數、檔案格式等更多項目。本章你將學會如何使用這個實用的函式庫,確保所有音訊檔都符合轉寫所需的格式。
在本章中,你會把所學整合起來,為一家科技公司 Acme Studios 建立語音處理的概念驗證專案。你將從把客服電話通話的音訊片段轉寫為文字開始,接著對轉寫文字進行情感分析(使用 NLTK)、具名實體辨識(使用 spaCy),以及文字分類(使用 scikit-learn)。