始める無料で始める

変数重要度を見極める

attrition データセットには、"Attrition" に関する 839 観測と 30 個の予測変数が含まれています。利用可能なすべての予測変数を使うモデルと、情報量の多い少数の変数に基づく縮小モデルとの性能トレードオフを調べたいと考えています。

この演習では、まずモデルを学習し、そのモデルの変数重要度を確認します。次の演習では、このモデルと縮小モデルを比較して、モデル性能を評価します。

環境には、traintest の分割、vip() パッケージ、そして事前に定義されたロジスティック回帰の model が用意されています。

この演習はコースの一部です

Rで学ぶ特徴量エンジニアリング

コースを見る

演習の手順

  • すべての予測変数を用いて Attrition をモデル化するレシピを作成します。
  • ワークフローを訓練データに当てはめます。
  • fit_full オブジェクトを使って、モデルの変数重要度を可視化します。
  • vip() の前に extract_fit_parsnip() 関数を適用し、必要な情報を渡します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Create a recipe that models Attrition using all the predictors
recipe_full <- ___(___, data = train)

workflow_full <- workflow() %>%
  add_model(model) %>%
  add_recipe(recipe_full)

# Fit the workflow to the training data
fit_full <- ___ %>%
  ___(data = train)

# Use the fit_full object to graph the variable importance of your model. Apply extract_fit_parsnip() function before vip()
fit_full %>% ___() %>%
  ___(aesthetics = list(fill = "steelblue"))
コードを編集して実行