Tolka resultaten
Det är nästan alltid viktigt att veta vilka särdrag som påverkar dina förutsägelser mest. Kanske är det oväntat – och i så fall är det en insikt i sig? Kanske räcker ett fåtal särdrag för att förklara större delen av modellens träffsäkerhet, vilket kan spara tid på att samla in eller bearbeta övriga särdrag.
I det här exemplet tittar vi på en modell som tränats utan någon LISTPRICE-information. Utan den – vad påverkar priset mest?
- OBS: Arrayen med särdragsvikter,
importances, har redan skapats åt dig frånmodel.featureImportances.toArray()
Den här övningen är en del av kursen
Feature Engineering med PySpark
Övningsinstruktioner
- Skapa en
pandas-dataram med värdena frånimportancesoch namnge kolumnenimportancegenom att ange parameterncolumns. - Använd den importerade listan med särdragsnamn,
feature_cols, och skapa en nypandas.Seriesgenom att skicka den till funktionenpd.Series(). Tilldela resultatet till kolumnenfi_df['feature']. - Sortera dataramen med
sort_values()genom att sätta parameternbytill kolumnenimportanceoch sortera i fallande ordning genom att sättaascendingtillFalse. Granska resultaten.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Convert feature importances to a pandas column
fi_df = pd.DataFrame(____, columns=[____])
# Convert list of feature names to pandas column
fi_df['feature'] = pd.____(____)
# Sort the data based on feature importance
fi_df.____(by=[____], ascending=____, inplace=True)
# Inspect Results
fi_df.head(10)