Resultaten interpreteren
Het is bijna altijd belangrijk om te weten welke features je voorspelling het meest beïnvloeden. Misschien is het tegenintuïtief en levert dat juist inzicht op? Misschien verklaren een handvol features het grootste deel van de nauwkeurigheid van je model en hoef je geen tijd te besteden aan het verzamelen of bewerken van andere features.
In dit voorbeeld bekijken we een model dat is getraind zonder enige LISTPRICE-informatie. Nu dat weg is, wat beïnvloedt de prijs het meest?
- LET OP: De array met feature-importances,
importances, is al voor je gemaakt metmodel.featureImportances.toArray()
Deze oefening maakt deel uit van de cursus
Feature Engineering met PySpark
Oefeninstructies
- Maak een
pandas-dataframe met de waarden vanimportancesen noem de kolomimportancedoor de parametercolumnste zetten. - Gebruik de geïmporteerde lijst met featurenamen,
feature_cols, en maak een nieuwepandas.Seriesdoor deze te wrappen in de functiepd.Series(). Zet deze in de kolomfi_df['feature']. - Sorteer het dataframe met
sort_values(), stel de parameterbyin op onzeimportance-kolom en sorteer aflopend doorascendingopFalsete zetten. Bekijk de resultaten.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Convert feature importances to a pandas column
fi_df = pd.DataFrame(____, columns=[____])
# Convert list of feature names to pandas column
fi_df['feature'] = pd.____(____)
# Sort the data based on feature importance
fi_df.____(by=[____], ascending=____, inplace=True)
# Inspect Results
fi_df.head(10)