ランダムフォレストのフルモデルを作成する
ランダムフォレストは、多数のサブツリーを特徴量のランダムな部分集合から構築するため、自然に特徴量選択を行います。特徴量の重要度を理解する一つの方法は、モデルを構築してから重要度を抽出することです。そこでこの演習では、Healthcare Job Attritionデータを使って rand_forest() による分類モデルを学習し、そこから特徴量重要度を抽出できるようにします。重要度を利用可能にするため、モデルは必ず importance = "impurity" を指定して作成してください。train と test の各データセットは用意されています。
tidyverse、tidymodels、vip パッケージは読み込まれています。
この演習はコースの一部です
Rによる次元削減
演習の手順
- 特徴量重要度を抽出できる、木を200本に設定したランダムフォレストの分類モデルを定義します。
- すべての説明変数でランダムフォレストモデルを学習します。
- 予測結果をテストデータに結合します。
- F1指標を計算します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Specify the random forest model
rf_spec <- ___(mode = "___", ___ = ___) %>%
set_engine("___", ___ = "___")
# Fit the random forest model with all predictors
rf_fit <- ___ %>%
___(___, data = ___)
# Create the test set prediction data frame
predict_df <- ___ %>%
bind_cols(predict = ___(___, ___))
# Calculate F1 performance
f_meas(predict_df, ___, .pred_class)