Interpretare i risultati
È quasi sempre importante sapere quali feature influenzano di più la tua previsione. Magari è controintuitivo, ed è proprio lì l’insight! Forse un pugno di feature spiega gran parte dell’accuratezza del tuo modello e non serve investire tempo per acquisire o ripulire altre feature.
In questo esempio analizzeremo un modello addestrato senza alcuna informazione su LISTPRICE. Senza quella variabile, che cosa influenza di più il prezzo?
- NOTA: L’array delle importanze delle feature,
importances, è già stato creato per te damodel.featureImportances.toArray()
Questo esercizio fa parte del corso
Feature Engineering con PySpark
Istruzioni dell'esercizio
- Crea un dataframe
pandasusando i valori diimportancese assegna alla colonna il nomeimportanceimpostando il parametrocolumns. - Usando la lista importata dei nomi delle feature,
feature_cols, crea una nuovapandas.Seriesincapsulandola con la funzionepd.Series(). Assegnala alla colonnafi_df['feature']. - Ordina il dataframe usando
sort_values(), impostando il parametrobysulla nostra colonnaimportancee ordina in modo discendente impostandoascendingsuFalse. Osserva i risultati.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Convert feature importances to a pandas column
fi_df = pd.DataFrame(____, columns=[____])
# Convert list of feature names to pandas column
fi_df['feature'] = pd.____(____)
# Sort the data based on feature importance
fi_df.____(by=[____], ascending=____, inplace=True)
# Inspect Results
fi_df.head(10)