填補遺漏資料
遺漏資料在所難免。若我們假設資料是完全隨機遺漏,就表示我們相信現有的資料能夠良好代表母體。若只有少量遺漏值,你可以直接移除,或用平均數或中位數來取代。在本練習中,我們要看看「'PDOM'」:以目前價格計算的在市天數(Days on Market at Current Price)。
本練習屬於課程
使用 PySpark 進行特徵工程
練習說明
- 使用
where()、isNull()和count()來計算欄位「'PDOM'」中的遺漏值數量。 - 使用彙總函式
mean()計算「'PDOM'」的平均值。 - 使用
fillna(),將取代值設為「'PDOM'」的平均值,並透過subset參數只套用在「'PDOM'」欄位。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Count missing rows
missing = df.____(df[____].____()).____()
# Calculate the mean value
col_mean = df.____({____: ____}).____()[0][0]
# Replacing with the mean value for that column
df.____(____, ____=[____])