始める無料で始める

ランダムフォレストのフルモデルを作成する

ランダムフォレストは、多数のサブツリーを特徴量のランダムな部分集合から構築するため、自然に特徴量選択を行います。特徴量の重要度を理解する一つの方法は、モデルを構築してから重要度を抽出することです。そこでこの演習では、Healthcare Job Attritionデータを使って rand_forest() による分類モデルを学習し、そこから特徴量重要度を抽出できるようにします。重要度を利用可能にするため、モデルは必ず importance = "impurity" を指定して作成してください。traintest の各データセットは用意されています。

tidyversetidymodelsvip パッケージは読み込まれています。

この演習はコースの一部です

Rによる次元削減

コースを見る

演習の手順

  • 特徴量重要度を抽出できる、木を200本に設定したランダムフォレストの分類モデルを定義します。
  • すべての説明変数でランダムフォレストモデルを学習します。
  • 予測結果をテストデータに結合します。
  • F1指標を計算します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Specify the random forest model
rf_spec <- ___(mode = "___", ___ = ___) %>% 
  set_engine("___", ___ = "___") 

# Fit the random forest model with all predictors
rf_fit <- ___ %>% 
  ___(___, data = ___)

# Create the test set prediction data frame
predict_df <- ___ %>% 
  bind_cols(predict = ___(___, ___))

# Calculate F1 performance
f_meas(predict_df, ___, .pred_class)
コードを編集して実行