填入虛擬值
就像你先前檢查欄與欄之間「遺漏對遺漏」是否相關一樣,檢查「遺漏對未遺漏」之間是否相關也很重要。這能幫你辨識資料中「遺漏的成因(missingness 的因素)」。
在上圖中,你可以看到 Serum Insulin 的遺漏值分散在 BMI 數值範圍內。這代表沒有關係!
在這個練習中,你會「撰寫一個函式來產生虛擬值」,以便在下一個練習中繪製上面的散佈圖。產生虛擬值的步驟包含:將隨機值依欄位範圍與縮放係數進行縮放,並再平移數值。
numpy.random 中的 rand() 已替你匯入。
本練習屬於課程
在 Python 中處理遺漏值
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
def fill_dummy_values(df):
df_dummy = df.copy(deep=True)
for col_name in df_dummy:
col = df_dummy[col_name]
# Calculate column range
col_range = ___ - ___
return df_dummy