การแทนค่าข้อมูลที่หายไป
ข้อมูลที่หายไปเป็นเรื่องปกติที่พบได้เสมอ หากสมมติว่าข้อมูลที่หายไปเกิดขึ้นแบบสุ่มโดยสมบูรณ์ นั่นหมายความว่าข้อมูลที่มีอยู่สามารถเป็นตัวแทนของประชากรโดยรวมได้ดี ในกรณีที่มีค่าหายไปเพียงไม่กี่ค่า อาจเลือกลบแถวนั้นออก หรือใช้ค่าเฉลี่ยหรือค่ามัธยฐานมาแทนแทน ในแบบฝึกหัดนี้ เราจะมาดูคอลัมน์ 'PDOM' ซึ่งหมายถึงจำนวนวันที่อสังหาริมทรัพย์อยู่ในตลาดที่ราคาปัจจุบัน
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Feature Engineering with PySpark
คำแนะนำการฝึกหัด
- นับจำนวนค่าที่หายไปในคอลัมน์
'PDOM'โดยใช้where(),isNull()และcount() - คำนวณค่าเฉลี่ยของ
'PDOM'โดยใช้ฟังก์ชัน Aggregatemean() - ใช้
fillna()โดยกำหนดค่าเป็นค่าเฉลี่ยของ'PDOM'และระบุคอลัมน์เป้าหมายด้วยพารามิเตอร์subset
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Count missing rows
missing = df.____(df[____].____()).____()
# Calculate the mean value
col_mean = df.____({____: ____}).____()[0][0]
# Replacing with the mean value for that column
df.____(____, ____=[____])