開始使用免費開始

填入虛擬值

就像你先前檢查欄與欄之間「遺漏對遺漏」是否相關一樣,檢查「遺漏對未遺漏」之間是否相關也很重要。這能幫你辨識資料中「遺漏的成因(missingness 的因素)」。

BMI vs Serum Insulin

在上圖中,你可以看到 Serum Insulin 的遺漏值分散在 BMI 數值範圍內。這代表沒有關係!

在這個練習中,你會「撰寫一個函式來產生虛擬值」,以便在下一個練習中繪製上面的散佈圖。產生虛擬值的步驟包含:將隨機值依欄位範圍與縮放係數進行縮放,並再平移數值。

numpy.random 中的 rand() 已替你匯入。

本練習屬於課程

在 Python 中處理遺漏值

檢視課程

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

def fill_dummy_values(df):
  df_dummy = df.copy(deep=True)
  for col_name in df_dummy:
    col = df_dummy[col_name]
    # Calculate column range
    col_range = ___ - ___
  return df_dummy
編輯並執行程式碼