始める無料で始める

特徴量重要度を使ってデータを縮約する

完全なランダムフォレストモデルを作成できたので、次は特徴量重要度を確認していきます。

ランダムフォレストは自然に(ただし暗黙的に)特徴量選択を行いますが、それでもモデルを縮約して構築すると有利なことが多いです。縮約モデルは学習が速く、予測計算も速く、理解・運用がしやすくなります。もちろん、モデルの単純さと性能の間には常にトレードオフがあります。

この演習では、データセットを縮約します。次の演習で、縮約モデルを当てはめ、完全モデルと性能を比較します。rf_fittraintest は用意されています。

tidyversetidymodelsvip パッケージは読み込まれています。

この演習はコースの一部です

Rによる次元削減

コースを見る

演習の手順

  • vi()rank 引数を指定して、最も重要な特徴量を10個抽出します。
  • 目的変数を上位特徴量リストに戻し入れます。
  • 上位特徴量のマスクを適用して、データセットを縮約します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Extract the top ten features
top_features <- ___ %>% 
  ___(___ = ___) %>% 
  filter(___) %>% 
  pull(Variable)

# Add the target variable to the feature list
top_features <- c(___, "___")

# Reduce and print the data sets
train_reduced <- train[___]
test_reduced <- ___[___]
train_reduced %>% head(5)
test_reduced %>% head(5)
コードを編集して実行