開始使用免費開始

使用隨機森林進行填補

相較於傳統統計模型,機器學習式的填補方法常常更精準,也更容易實作。首先,你不需要事先指定變數之間的關係。此外,像是隨機森林這類的機器學習模型,能找到高度複雜且非線性的關聯,並用來預測遺漏值。

在這個練習中,你會熟悉 missForest 套件。它會為每一個變數各自建立一個隨機森林,逐一預測遺漏值。你會在本課先前使用過的傳記電影資料 biopics 上呼叫填補函式,接著擷取填補完成的資料,以及估計的填補誤差。

準備來種些隨機森林吧!

本練習屬於課程

在 R 中以插補處理遺漏值

檢視課程

練習說明

  • 載入 missForest 套件。
  • 使用 missForest()biopics 資料進行遺漏值填補;將結果指定給 imp_res
  • imp_res 擷取填補後的資料集,指定給 imp_data,並檢查遺漏值的數量是否真的為 0。
  • imp_res 擷取估計的填補誤差,指定給 imp_err,並將其印出到主控台。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Load the missForest package
___

# Impute biopics data using missForest
imp_res <- ___(___)

# Extract imputed data and check for missing values
imp_data <- imp_res$___
print(___(___(___)))

# Extract and print imputation errors
imp_err <- imp_res$___
print(___)
編輯並執行程式碼