始める無料で始める

ランダムフォレストによる補完

機械学習を使った補完アプローチは、従来の統計モデルと比べて、精度が高く、かつ実装も簡単です。変数間の関係を事前に指定する必要がなく、ランダムフォレストのような機械学習モデルは、複雑な非線形の関係も自動的に発見し、それを活用して欠損値を予測できます。

この演習では、missForest パッケージを使ってみましょう。このパッケージは、各変数の欠損値を予測するためのランダムフォレストを個別に構築します。コース前半でも使用した人物伝映画データ biopics に対して補完関数を実行し、補完済みデータと推定補完誤差を取り出します。

さっそくランダムフォレストを育ててみましょう!

この演習はコースの一部です

R による欠損データの補完処理

コースを見る

演習の手順

  • missForest パッケージを読み込みましょう。
  • missForest() を使って biopics データの欠損値を補完し、結果を imp_res に代入しましょう。
  • imp_res から補完済みデータセットを取り出して imp_data に代入し、欠損値の数が本当にゼロになっているか確認しましょう。
  • imp_res から推定補完誤差を取り出して imp_err に代入し、コンソールに出力しましょう。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Load the missForest package
___

# Impute biopics data using missForest
imp_res <- ___(___)

# Extract imputed data and check for missing values
imp_data <- imp_res$___
print(___(___(___)))

# Extract and print imputation errors
imp_err <- imp_res$___
print(___)
コードを編集して実行