เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การ impute ด้วย KNN

ชุดข้อมูลมักมีฟีเจอร์ที่มีความสัมพันธ์กัน ดังนั้นการนำความสัมพันธ์เหล่านี้มาพิจารณาในการ impute ค่าที่หายไปจึงเป็นสิ่งสำคัญ โมเดล machine learning ใช้ฟีเจอร์ใน DataFrame เพื่อค้นหาความสัมพันธ์และรูปแบบในข้อมูล แล้วจึงทำนายฟีเจอร์ที่ต้องการ

หนึ่งในโมเดลที่เรียบง่ายและมีประสิทธิภาพมากที่สุดคือ K Nearest Neighbors ซึ่งจะค้นหาจุดข้อมูล 'K' จุดที่ใกล้เคียงกับข้อมูลที่มีอยู่มากที่สุด เพื่อนำมา impute ค่าที่หายไป

ในแบบฝึกหัดนี้ DataFrame diabetes ถูกโหลดไว้ให้แล้ว ให้ใช้แพ็กเกจ fancyimpute เพื่อ impute ค่าที่หายไปใน DataFrame diabetes

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การจัดการข้อมูลที่หายไปใน Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • Import KNN จาก fancyimpute
  • คัดลอก diabetes ไปยัง diabetes_knn_imputed
  • สร้างออบเจกต์ KNN() และกำหนดให้กับตัวแปร knn_imputer
  • Impute DataFrame diabetes_knn_imputed

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import KNN from fancyimpute
___

# Copy diabetes to diabetes_knn_imputed
diabetes_knn_imputed = ___

# Initialize KNN
knn_imputer = ___

# Impute using fit_tranform on diabetes_knn_imputed
diabetes_knn_imputed.iloc[:, :] = ___
แก้ไขและรันโค้ด