始める無料で始める

重要な特徴量の並べ替え

Decision Tree が人気な理由のひとつは、その解釈性の高さです。正確に予測できるモデルは他にもありますが、Decision Tree は各特徴量が目的変数に与える影響の大きさを数値化できます。ここでは、退職(離職)の意思決定に最も影響する特徴量と、影響が小さい特徴量を特定できます。sklearn では、この情報を feature_importances_ 属性で取得できます。

この演習では、各特徴量の重要度を数値として取得し、pandas の DataFrame(Python で扱う表形式データ)に保存し、重要度が高い順に並べ替えます。前の演習で使用した model_ best の Decision Tree Classifier に加えて、features_testfeatures_train の変数がワークスペースに用意されています。

pandaspd としてインポート済みです。

この演習はコースの一部です

HRアナリティクス:Pythonで従業員離職を予測する

コースを見る

演習の手順

  • feature_importances_ 属性を使って、相対的な特徴量の重要度を計算します
  • 特徴量名のリストを作成します
  • DataFrame() 関数を使って結果を DataFrame に保存します。行に特徴量、列にそれぞれの値が入る形にします
  • sort_values() 関数で relative_importances DataFrame を並べ替え、重要度の高い特徴量が上にくるようにして、結果を出力します

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Calculate feature importances
feature_importances = model_best.____

# Create a list of features: done
feature_list = list(features)

# Save the results inside a DataFrame using feature_list as an index
relative_importances = pd.____(index=____, data=feature_importances, columns=["importance"])

# Sort values to learn most important features
relative_importances.____(by="importance", ascending=False)
コードを編集して実行