Nội suy bằng KNN
Các bộ dữ liệu luôn có những đặc trưng tương quan với nhau. Vì vậy, việc xem chúng như một yếu tố khi nội suy (impute) giá trị khuyết là rất quan trọng. Các mô hình Machine Learning sử dụng các đặc trưng trong DataFrame để tìm tương quan và mẫu hình nhằm dự đoán một đặc trưng được chọn.
Một trong những mô hình đơn giản và hiệu quả nhất là K Nearest Neighbors. Mô hình này tìm 'K' điểm giống nhất với các điểm dữ liệu hiện có để nội suy các giá trị bị thiếu.
Trong bài tập này, DataFrame diabetes đã được nạp sẵn cho bạn. Hãy dùng gói fancyimpute để nội suy các giá trị khuyết trong DataFrame diabetes.
Bài tập này là một phần của khóa học
Xử lý Dữ liệu Khuyết trong Python
Hướng dẫn bài tập
- Import
KNNtừfancyimpute. - Sao chép
diabetesthànhdiabetes_knn_imputed. - Tạo một đối tượng
KNN()và gán choknn_imputer. - Nội suy DataFrame
diabetes_knn_imputed.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import KNN from fancyimpute
___
# Copy diabetes to diabetes_knn_imputed
diabetes_knn_imputed = ___
# Initialize KNN
knn_imputer = ___
# Impute using fit_tranform on diabetes_knn_imputed
diabetes_knn_imputed.iloc[:, :] = ___