Interpretarea rezultatelor
Este aproape întotdeauna important să știi care caracteristici influențează cel mai mult predicțiile modelului tău. Poate că rezultatul este contraintuitiv – și tocmai acesta poate fi un insight valoros! Sau poate că doar câteva caracteristici răspund pentru cea mai mare parte din acuratețea modelului, iar celelalte nu mai merită efortul de colectare sau prelucrare.
În acest exemplu vom analiza un model antrenat fără nicio informație despre LISTPRICE. Fără aceasta, ce influențează cel mai mult prețul?
- NOTĂ: Vectorul importanțelor caracteristicilor,
importances, a fost deja creat pentru tine dinmodel.featureImportances.toArray()
Acest exercițiu face parte din cursul
Feature Engineering cu PySpark
Instrucțiuni pentru exercițiu
- Creează un dataframe
pandasfolosind valorile dinimportancesși denumește coloanaimportanceprin setarea parametruluicolumns. - Folosind lista importată de nume de caracteristici,
feature_cols, creează o nouăpandas.Seriesînfășurând-o în funcțiapd.Series(). Atribuie rezultatul coloaneifi_df['feature']. - Sortează dataframe-ul folosind
sort_values(), setând parametrulbyla coloanaimportanceși sortând descrescător prin setareaascendinglaFalse. Inspectează rezultatele.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Convert feature importances to a pandas column
fi_df = pd.DataFrame(____, columns=[____])
# Convert list of feature names to pandas column
fi_df['feature'] = pd.____(____)
# Sort the data based on feature importance
fi_df.____(by=[____], ascending=____, inplace=True)
# Inspect Results
fi_df.head(10)