LoslegenKostenlos starten

Ergebnisse interpretieren

Es ist fast immer wichtig zu wissen, welche Features deine Vorhersage am stärksten beeinflussen. Vielleicht ist es kontraintuitiv – und genau darin liegt eine Erkenntnis? Vielleicht erklären eine Handvoll Features den Großteil der Genauigkeit deines Modells, und du musst keine Zeit darauf verwenden, weitere Features zu beschaffen oder aufzubereiten.

In diesem Beispiel betrachten wir ein Modell, das ohne jegliche LISTPRICE-Informationen trainiert wurde. Wenn diese fehlt: Was beeinflusst den Preis am meisten?

  • HINWEIS: Das Array der Feature-Important-Werte, importances, wurde bereits für dich aus model.featureImportances.toArray() erzeugt.

Diese Übung ist Teil des Kurses

<Kurs>Feature Engineering mit PySpark</Kurs>
Kurs ansehen

Übungsanweisungen

  • Erstelle ein pandas-DataFrame mit den Werten von importances und benenne die Spalte importance, indem du den Parameter columns setzt.
  • Erstelle mit der importierten Liste der Feature-Namen, feature_cols, eine neue pandas.Series, indem du sie in die Funktion pd.Series() packst. Weise sie der Spalte fi_df['feature'] zu.
  • Sortiere das DataFrame mit sort_values(), setze den Parameter by auf unsere Spalte importance und sortiere absteigend, indem du ascending auf False setzt. Sieh dir die Ergebnisse an.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Convert feature importances to a pandas column
fi_df = pd.DataFrame(____, columns=[____])

# Convert list of feature names to pandas column
fi_df['feature'] = pd.____(____)

# Sort the data based on feature importance
fi_df.____(by=[____], ascending=____, inplace=True)

# Inspect Results
fi_df.head(10)
Code bearbeiten und ausführen