使用隨機森林進行填補
相較於傳統統計模型,機器學習式的填補方法常常更精準,也更容易實作。首先,你不需要事先指定變數之間的關係。此外,像是隨機森林這類的機器學習模型,能找到高度複雜且非線性的關聯,並用來預測遺漏值。
在這個練習中,你會熟悉 missForest 套件。它會為每一個變數各自建立一個隨機森林,逐一預測遺漏值。你會在本課先前使用過的傳記電影資料 biopics 上呼叫填補函式,接著擷取填補完成的資料,以及估計的填補誤差。
準備來種些隨機森林吧!
本練習屬於課程
在 R 中以插補處理遺漏值
練習說明
- 載入
missForest套件。 - 使用
missForest()對biopics資料進行遺漏值填補;將結果指定給imp_res。 - 從
imp_res擷取填補後的資料集,指定給imp_data,並檢查遺漏值的數量是否真的為 0。 - 從
imp_res擷取估計的填補誤差,指定給imp_err,並將其印出到主控台。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Load the missForest package
___
# Impute biopics data using missForest
imp_res <- ___(___)
# Extract imputed data and check for missing values
imp_data <- imp_res$___
print(___(___(___)))
# Extract and print imputation errors
imp_err <- imp_res$___
print(___)