Aan de slagBegin gratis

Resultaten interpreteren

Het is bijna altijd belangrijk om te weten welke features je voorspelling het meest beïnvloeden. Misschien is het tegenintuïtief en levert dat juist inzicht op? Misschien verklaren een handvol features het grootste deel van de nauwkeurigheid van je model en hoef je geen tijd te besteden aan het verzamelen of bewerken van andere features.

In dit voorbeeld bekijken we een model dat is getraind zonder enige LISTPRICE-informatie. Nu dat weg is, wat beïnvloedt de prijs het meest?

  • LET OP: De array met feature-importances, importances, is al voor je gemaakt met model.featureImportances.toArray()

Deze oefening maakt deel uit van de cursus

Feature Engineering met PySpark

Bekijk cursus

Oefeninstructies

  • Maak een pandas-dataframe met de waarden van importances en noem de kolom importance door de parameter columns te zetten.
  • Gebruik de geïmporteerde lijst met featurenamen, feature_cols, en maak een nieuwe pandas.Series door deze te wrappen in de functie pd.Series(). Zet deze in de kolom fi_df['feature'].
  • Sorteer het dataframe met sort_values(), stel de parameter by in op onze importance-kolom en sorteer aflopend door ascending op False te zetten. Bekijk de resultaten.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# Convert feature importances to a pandas column
fi_df = pd.DataFrame(____, columns=[____])

# Convert list of feature names to pandas column
fi_df['feature'] = pd.____(____)

# Sort the data based on feature importance
fi_df.____(by=[____], ascending=____, inplace=True)

# Inspect Results
fi_df.head(10)
Code bewerken en uitvoeren