Bắt đầu ngayBắt đầu miễn phí

Loại bỏ dữ liệu thiếu

Trong ba bài tập tới, bạn sẽ dọn dẹp tập dữ liệu music_df. Bạn sẽ tạo một pipeline để bù giá trị thiếu và xây dựng một mô hình phân loại KNN, sau đó dùng nó để dự đoán liệu một bài hát có thuộc thể loại "Rock" hay không.

Riêng trong bài tập này, bạn sẽ loại bỏ các giá trị thiếu chiếm dưới 5% của tập dữ liệu, và chuyển cột "genre" thành một đặc trưng nhị phân.

Bài tập này là một phần của khóa học

Học có giám sát với scikit-learn

Xem khóa học

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Print missing values for each column
____
Chỉnh sửa và Chạy Mã