Loại bỏ dữ liệu thiếu
Trong ba bài tập tới, bạn sẽ dọn dẹp tập dữ liệu music_df. Bạn sẽ tạo một pipeline để bù giá trị thiếu và xây dựng một mô hình phân loại KNN, sau đó dùng nó để dự đoán liệu một bài hát có thuộc thể loại "Rock" hay không.
Riêng trong bài tập này, bạn sẽ loại bỏ các giá trị thiếu chiếm dưới 5% của tập dữ liệu, và chuyển cột "genre" thành một đặc trưng nhị phân.
Bài tập này là một phần của khóa học
Học có giám sát với scikit-learn
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Print missing values for each column
____