開始使用免費開始

填補遺漏資料

遺漏資料在所難免。若我們假設資料是完全隨機遺漏,就表示我們相信現有的資料能夠良好代表母體。若只有少量遺漏值,你可以直接移除,或用平均數或中位數來取代。在本練習中,我們要看看「'PDOM'」:以目前價格計算的在市天數(Days on Market at Current Price)。

本練習屬於課程

使用 PySpark 進行特徵工程

檢視課程

練習說明

  • 使用 where()isNull()count() 來計算欄位「'PDOM'」中的遺漏值數量。
  • 使用彙總函式 mean() 計算「'PDOM'」的平均值。
  • 使用 fillna(),將取代值設為「'PDOM'」的平均值,並透過 subset 參數只套用在「'PDOM'」欄位。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Count missing rows
missing = df.____(df[____].____()).____()

# Calculate the mean value
col_mean = df.____({____: ____}).____()[0][0]

# Replacing with the mean value for that column
df.____(____, ____=[____])
編輯並執行程式碼