Ergebnisse interpretieren
Es ist fast immer wichtig zu wissen, welche Features deine Vorhersage am stärksten beeinflussen. Vielleicht ist es kontraintuitiv – und genau darin liegt eine Erkenntnis? Vielleicht erklären eine Handvoll Features den Großteil der Genauigkeit deines Modells, und du musst keine Zeit darauf verwenden, weitere Features zu beschaffen oder aufzubereiten.
In diesem Beispiel betrachten wir ein Modell, das ohne jegliche LISTPRICE-Informationen trainiert wurde. Wenn diese fehlt: Was beeinflusst den Preis am meisten?
- HINWEIS: Das Array der Feature-Important-Werte,
importances, wurde bereits für dich ausmodel.featureImportances.toArray()erzeugt.
Diese Übung ist Teil des Kurses
<Kurs>Feature Engineering mit PySpark</Kurs>Übungsanweisungen
- Erstelle ein
pandas-DataFrame mit den Werten vonimportancesund benenne die Spalteimportance, indem du den Parametercolumnssetzt. - Erstelle mit der importierten Liste der Feature-Namen,
feature_cols, eine neuepandas.Series, indem du sie in die Funktionpd.Series()packst. Weise sie der Spaltefi_df['feature']zu. - Sortiere das DataFrame mit
sort_values(), setze den Parameterbyauf unsere Spalteimportanceund sortiere absteigend, indem duascendingaufFalsesetzt. Sieh dir die Ergebnisse an.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Convert feature importances to a pandas column
fi_df = pd.DataFrame(____, columns=[____])
# Convert list of feature names to pandas column
fi_df['feature'] = pd.____(____)
# Sort the data based on feature importance
fi_df.____(by=[____], ascending=____, inplace=True)
# Inspect Results
fi_df.head(10)