Kom igångKom igång gratis

Tolka resultaten

Det är nästan alltid viktigt att veta vilka särdrag som påverkar dina förutsägelser mest. Kanske är det oväntat – och i så fall är det en insikt i sig? Kanske räcker ett fåtal särdrag för att förklara större delen av modellens träffsäkerhet, vilket kan spara tid på att samla in eller bearbeta övriga särdrag.

I det här exemplet tittar vi på en modell som tränats utan någon LISTPRICE-information. Utan den – vad påverkar priset mest?

  • OBS: Arrayen med särdragsvikter, importances, har redan skapats åt dig från model.featureImportances.toArray()

Den här övningen är en del av kursen

Feature Engineering med PySpark

Visa kurs

Övningsinstruktioner

  • Skapa en pandas-dataram med värdena från importances och namnge kolumnen importance genom att ange parametern columns.
  • Använd den importerade listan med särdragsnamn, feature_cols, och skapa en ny pandas.Series genom att skicka den till funktionen pd.Series(). Tilldela resultatet till kolumnen fi_df['feature'].
  • Sortera dataramen med sort_values() genom att sätta parametern by till kolumnen importance och sortera i fallande ordning genom att sätta ascending till False. Granska resultaten.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Convert feature importances to a pandas column
fi_df = pd.DataFrame(____, columns=[____])

# Convert list of feature names to pandas column
fi_df['feature'] = pd.____(____)

# Sort the data based on feature importance
fi_df.____(by=[____], ascending=____, inplace=True)

# Inspect Results
fi_df.head(10)
Redigera och kör kod