開始使用免費開始

排序重要特徵

決策樹(Decision Trees)之所以廣受歡迎,其中一個原因就是具備良好的可解釋性。許多模型都能提供準確的預測,但決策樹還能量化各個特徵對目標的影響。在這裡,它能告訴你哪些特徵對離職決策的影響最大、哪些最小。在 sklearn 中,你可以使用 feature_importances_ 屬性取得這項資訊。

在這個練習中,你要取得每個特徵的量化重要性,將它們存成一個 pandas DataFrame(Python 風格的表格),並依重要性由高到低排序。前面練習中使用的 model_ best 決策樹分類器已經可在你的工作區使用,features_testfeatures_train 這兩個變數也都已提供。

pandas 已以 pd 匯入。

本練習屬於課程

HR 分析:用 Python 預測員工流失

檢視課程

練習說明

  • 使用 feature_importances_ 屬性計算相對特徵重要性。
  • 建立特徵名稱的清單。
  • 使用 DataFrame() 函式將結果存入 DataFrame,讓特徵作為列,對應的重要性值作為一個欄位。
  • 使用 sort_values() 函式將 relative_importances DataFrame 由高到低排序,讓最重要的特徵排在最前面,並印出結果。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Calculate feature importances
feature_importances = model_best.____

# Create a list of features: done
feature_list = list(features)

# Save the results inside a DataFrame using feature_list as an index
relative_importances = pd.____(index=____, data=feature_importances, columns=["importance"])

# Sort values to learn most important features
relative_importances.____(by="importance", ascending=False)
編輯並執行程式碼