変数重要度を見極める
attrition データセットには、"Attrition" に関する 839 観測と 30 個の予測変数が含まれています。利用可能なすべての予測変数を使うモデルと、情報量の多い少数の変数に基づく縮小モデルとの性能トレードオフを調べたいと考えています。
この演習では、まずモデルを学習し、そのモデルの変数重要度を確認します。次の演習では、このモデルと縮小モデルを比較して、モデル性能を評価します。
環境には、train と test の分割、vip() パッケージ、そして事前に定義されたロジスティック回帰の model が用意されています。
この演習はコースの一部です
Rで学ぶ特徴量エンジニアリング
演習の手順
- すべての予測変数を用いて
Attritionをモデル化するレシピを作成します。 - ワークフローを訓練データに当てはめます。
fit_fullオブジェクトを使って、モデルの変数重要度を可視化します。vip()の前にextract_fit_parsnip()関数を適用し、必要な情報を渡します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create a recipe that models Attrition using all the predictors
recipe_full <- ___(___, data = train)
workflow_full <- workflow() %>%
add_model(model) %>%
add_recipe(recipe_full)
# Fit the workflow to the training data
fit_full <- ___ %>%
___(data = train)
# Use the fit_full object to graph the variable importance of your model. Apply extract_fit_parsnip() function before vip()
fit_full %>% ___() %>%
___(aesthetics = list(fill = "steelblue"))