排序重要特徵
決策樹(Decision Trees)之所以廣受歡迎,其中一個原因就是具備良好的可解釋性。許多模型都能提供準確的預測,但決策樹還能量化各個特徵對目標的影響。在這裡,它能告訴你哪些特徵對離職決策的影響最大、哪些最小。在 sklearn 中,你可以使用 feature_importances_ 屬性取得這項資訊。
在這個練習中,你要取得每個特徵的量化重要性,將它們存成一個 pandas DataFrame(Python 風格的表格),並依重要性由高到低排序。前面練習中使用的 model_ best 決策樹分類器已經可在你的工作區使用,features_test 和 features_train 這兩個變數也都已提供。
pandas 已以 pd 匯入。
本練習屬於課程
HR 分析:用 Python 預測員工流失
練習說明
- 使用
feature_importances_屬性計算相對特徵重要性。 - 建立特徵名稱的清單。
- 使用
DataFrame()函式將結果存入 DataFrame,讓特徵作為列,對應的重要性值作為一個欄位。 - 使用
sort_values()函式將relative_importancesDataFrame 由高到低排序,讓最重要的特徵排在最前面,並印出結果。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Calculate feature importances
feature_importances = model_best.____
# Create a list of features: done
feature_list = list(features)
# Save the results inside a DataFrame using feature_list as an index
relative_importances = pd.____(index=____, data=feature_importances, columns=["importance"])
# Sort values to learn most important features
relative_importances.____(by="importance", ascending=False)