Sortera viktiga särdrag
Beslutsträd är mycket populära av flera anledningar, inte minst på grund av sin tolkbarhet. Många modeller kan ge träffsäkra förutsägelser, men beslutsträd kan dessutom kvantifiera hur de olika särdragen påverkar målvariabeln. Här kan modellen visa dig vilka särdrag som har störst respektive minst inverkan på beslutet att lämna företaget. I sklearn får du tillgång till den här informationen via attributet feature_importances_.
I den här övningen ska du hämta den kvantifierade vikten för varje särdrag, spara dem i en pandas DataFrame (en pythonisk tabell) och sortera dem från viktigast till minst viktigt. Beslutsträdsklassificeraren model_best från tidigare övningar finns tillgänglig i din arbetsmiljö, liksom variablerna features_test och features_train.
pandas har importerats som pd.
Den här övningen är en del av kursen
HR-analys: Förutsäg personalomsättning i Python
Övningsinstruktioner
- Använd attributet
feature_importances_för att beräkna relativa särdragsvikter - Skapa en lista över särdrag
- Spara resultaten i en DataFrame med hjälp av funktionen
DataFrame(), där särdragen utgör rader och deras respektive värden bildar en kolumn - Sortera DataFrame:en
relative_importancesså att de viktigaste särdragen hamnar överst – använd funktionensort_values()och skriv ut resultatet
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Calculate feature importances
feature_importances = model_best.____
# Create a list of features: done
feature_list = list(features)
# Save the results inside a DataFrame using feature_list as an index
relative_importances = pd.____(index=____, data=feature_importances, columns=["importance"])
# Sort values to learn most important features
relative_importances.____(by="importance", ascending=False)