ランダムフォレストによる補完
機械学習を使った補完アプローチは、従来の統計モデルと比べて、精度が高く、かつ実装も簡単です。変数間の関係を事前に指定する必要がなく、ランダムフォレストのような機械学習モデルは、複雑な非線形の関係も自動的に発見し、それを活用して欠損値を予測できます。
この演習では、missForest パッケージを使ってみましょう。このパッケージは、各変数の欠損値を予測するためのランダムフォレストを個別に構築します。コース前半でも使用した人物伝映画データ biopics に対して補完関数を実行し、補完済みデータと推定補完誤差を取り出します。
さっそくランダムフォレストを育ててみましょう!
この演習はコースの一部です
R による欠損データの補完処理
演習の手順
missForestパッケージを読み込みましょう。missForest()を使ってbiopicsデータの欠損値を補完し、結果をimp_resに代入しましょう。imp_resから補完済みデータセットを取り出してimp_dataに代入し、欠損値の数が本当にゼロになっているか確認しましょう。imp_resから推定補完誤差を取り出してimp_errに代入し、コンソールに出力しましょう。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Load the missForest package
___
# Impute biopics data using missForest
imp_res <- ___(___)
# Extract imputed data and check for missing values
imp_data <- imp_res$___
print(___(___(___)))
# Extract and print imputation errors
imp_err <- imp_res$___
print(___)