(Này bạn) Âm thanh gì thế?
Các bài hát bắt đầu là những thứ tương tự: âm thanh thực chất là vô số dao động của không khí. Để phân tích một bài hát, bạn cần biến nó thành các con số có ý nghĩa. Mỗi track trong Million Song Dataset có mười hai phép đo timbre được ghi nhận theo các khoảng thời gian đều đặn trong suốt bài hát. (Timbre là thước đo chất lượng cảm nhận của âm thanh; ví dụ, bạn có thể dùng nó để phân biệt giọng hát với nhạc cụ dây hay bộ gõ.)
Trong chương này, bạn sẽ thử dự đoán năm phát hành của một track dựa trên timbre của nó. Tức là bạn sẽ dùng các phép đo timbre này để tạo ra các feature cho mô hình. (Nhắc lại, feature là thuật ngữ trong Machine Learning chỉ biến đầu vào của mô hình. Trong thống kê, chúng thường được gọi là biến giải thích.)
Dữ liệu timbre có dạng một ma trận, với các hàng là các mốc thời gian và các cột là những phép đo timbre khác nhau. Vì thế mọi ma trận timbre đều có mười hai cột, nhưng số hàng khác nhau giữa các bài hát. Giá trị trung bình của mỗi cột ước lượng mức trung bình của phép đo timbre trên toàn bộ bài hát. Từ đó có thể tạo ra mười hai feature cho mô hình.
Bài tập này là một phần của khóa học
Nhập môn Spark với sparklyr trong R
Hướng dẫn bài tập
timbre, chứa các phép đo timbre cho bài "Poker Face" của Lady Gaga, đã được định nghĩa sẵn trong không gian làm việc của bạn.
- Dùng
colMeans()để lấy trung bình theo cột củatimbre. Gán kết quả vàomean_timbre.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# timbre has been pre-defined
timbre
# Calculate column means
(mean_timbre <- ___)