(喂,你)那是什麼聲音?
歌曲一開始是類比的東西:聲音其實是空氣的振動。若要分析一首歌,你需要把它轉成有意義的數值。Million Song Dataset 中的每一首歌,都在整首歌的規律時間點量測了 12 種音色(timbre)指標。音色是對聲音感知品質的量測;例如,你可以用它來分辨人聲、弦樂與打擊樂的差異。
在本章中,你會嘗試根據音色來預測歌曲發行的年份。也就是說,你會用這些音色量測值來產生模型所需的特徵。(回想一下,機器學習中的「特徵」指的是模型的輸入變數;在統計學中常稱為解釋變數。)
音色資料是一個矩陣:列代表時間點,欄代表不同的音色量測。因此所有音色矩陣都有 12 欄,但列數會因歌曲而異。每一欄的平均值可以估計該音色量測在整首歌上的平均表現。這些平均值可用來為模型產生 12 個特徵。
本練習屬於課程
使用 R 的 sparklyr:Spark 入門
練習說明
timbre(Lady Gaga 的「Poker Face」之音色量測)已在你的工作環境中預先定義。
- 使用
colMeans()取得timbre的各欄平均值,並將結果指定給mean_timbre。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# timbre has been pre-defined
timbre
# Calculate column means
(mean_timbre <- ___)