Seřazení důležitých příznaků
Rozhodovací stromy jsou oblíbené mimo jiné pro svou srozumitelnost. Mnoho modelů dokáže přesně předpovídat, ale rozhodovací stromy navíc umožňují kvantifikovat vliv jednotlivých příznaků na cílovou proměnnou. V tomto případě ti mohou říct, které příznaky mají největší a nejmenší vliv na rozhodnutí zaměstnance odejít z firmy. V sklearn tuto informaci získáš pomocí atributu feature_importances_.
V tomto cvičení získáš kvantifikovanou důležitost každého příznaku, uložíš ji do pandas DataFrame (tabulky v pythonním stylu) a seřadíš ji od nejdůležitějšího příznaku po nejméně důležitý. Klasifikátor rozhodovacího stromu model_best použitý v předchozích cvičeních je dostupný v tvém pracovním prostoru, stejně jako proměnné features_test a features_train.
pandas byl importován jako pd.
Toto cvičení je součástí kurzu
HR Analytics: Predicting Employee Churn in Python
Pokyny k cvičení
- Pomocí atributu
feature_importances_vypočítej relativní důležitost příznaků. - Vytvoř seznam příznaků.
- Výsledky ulož do DataFrame pomocí funkce
DataFrame(), kde příznaky budou řádky a jejich hodnoty budou sloupec. - Seřaď DataFrame
relative_importancestak, aby nejdůležitější příznaky byly nahoře – použij funkcisort_values()– a výsledek vypiš.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Calculate feature importances
feature_importances = model_best.____
# Create a list of features: done
feature_list = list(features)
# Save the results inside a DataFrame using feature_list as an index
relative_importances = pd.____(index=____, data=feature_importances, columns=["importance"])
# Sort values to learn most important features
relative_importances.____(by="importance", ascending=False)