Začněte nyníZačněte zdarma

Seřazení důležitých příznaků

Rozhodovací stromy jsou oblíbené mimo jiné pro svou srozumitelnost. Mnoho modelů dokáže přesně předpovídat, ale rozhodovací stromy navíc umožňují kvantifikovat vliv jednotlivých příznaků na cílovou proměnnou. V tomto případě ti mohou říct, které příznaky mají největší a nejmenší vliv na rozhodnutí zaměstnance odejít z firmy. V sklearn tuto informaci získáš pomocí atributu feature_importances_.

V tomto cvičení získáš kvantifikovanou důležitost každého příznaku, uložíš ji do pandas DataFrame (tabulky v pythonním stylu) a seřadíš ji od nejdůležitějšího příznaku po nejméně důležitý. Klasifikátor rozhodovacího stromu model_best použitý v předchozích cvičeních je dostupný v tvém pracovním prostoru, stejně jako proměnné features_test a features_train.

pandas byl importován jako pd.

Toto cvičení je součástí kurzu

HR Analytics: Predicting Employee Churn in Python

Zobrazit kurz

Pokyny k cvičení

  • Pomocí atributu feature_importances_ vypočítej relativní důležitost příznaků.
  • Vytvoř seznam příznaků.
  • Výsledky ulož do DataFrame pomocí funkce DataFrame(), kde příznaky budou řádky a jejich hodnoty budou sloupec.
  • Seřaď DataFrame relative_importances tak, aby nejdůležitější příznaky byly nahoře – použij funkci sort_values() – a výsledek vypiš.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Calculate feature importances
feature_importances = model_best.____

# Create a list of features: done
feature_list = list(features)

# Save the results inside a DataFrame using feature_list as an index
relative_importances = pd.____(index=____, data=feature_importances, columns=["importance"])

# Sort values to learn most important features
relative_importances.____(by="importance", ascending=False)
Upravit a spustit kód