การ impute ด้วย KNN
ชุดข้อมูลมักมีฟีเจอร์ที่มีความสัมพันธ์กัน ดังนั้นการนำความสัมพันธ์เหล่านี้มาพิจารณาในการ impute ค่าที่หายไปจึงเป็นสิ่งสำคัญ โมเดล machine learning ใช้ฟีเจอร์ใน DataFrame เพื่อค้นหาความสัมพันธ์และรูปแบบในข้อมูล แล้วจึงทำนายฟีเจอร์ที่ต้องการ
หนึ่งในโมเดลที่เรียบง่ายและมีประสิทธิภาพมากที่สุดคือ K Nearest Neighbors ซึ่งจะค้นหาจุดข้อมูล 'K' จุดที่ใกล้เคียงกับข้อมูลที่มีอยู่มากที่สุด เพื่อนำมา impute ค่าที่หายไป
ในแบบฝึกหัดนี้ DataFrame diabetes ถูกโหลดไว้ให้แล้ว ให้ใช้แพ็กเกจ fancyimpute เพื่อ impute ค่าที่หายไปใน DataFrame diabetes
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การจัดการข้อมูลที่หายไปใน Python
คำแนะนำการฝึกหัด
- Import
KNNจากfancyimpute - คัดลอก
diabetesไปยังdiabetes_knn_imputed - สร้างออบเจกต์
KNN()และกำหนดให้กับตัวแปรknn_imputer - Impute DataFrame
diabetes_knn_imputed
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import KNN from fancyimpute
___
# Copy diabetes to diabetes_knn_imputed
diabetes_knn_imputed = ___
# Initialize KNN
knn_imputer = ___
# Impute using fit_tranform on diabetes_knn_imputed
diabetes_knn_imputed.iloc[:, :] = ___