Interpretace výsledků
Téměř vždy je důležité vědět, které příznaky mají na tvůj předpověď největší vliv. Možná je výsledek překvapivý — a to samo o sobě může být cenný poznatek. Nebo možná jen několik příznaků zajišťuje většinu přesnosti modelu a není třeba trávit čas získáváním nebo úpravou těch ostatních.
V tomto příkladu se podíváme na model natrénovaný bez jakýchkoli informací z LISTPRICE. Co tedy nejvíce ovlivňuje cenu?
- POZNÁMKA: Pole důležitostí příznaků
importancesuž bylo vytvořeno zmodel.featureImportances.toArray().
Toto cvičení je součástí kurzu
Feature Engineering with PySpark
Pokyny k cvičení
- Vytvoř
pandasdataframe s hodnotami zimportancesa pojmenuj sloupecimportancenastavením parametrucolumns. - Pomocí importovaného seznamu názvů příznaků
feature_colsvytvoř novoupandas.Serieszabalením do funkcepd.Series(). Přiřaď ji ke sloupcifi_df['feature']. - Seřaď dataframe pomocí
sort_values(), nastav parametrbyna náš sloupecimportancea řaď sestupně nastavenímascendingnaFalse. Prohlédni si výsledky.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Convert feature importances to a pandas column
fi_df = pd.DataFrame(____, columns=[____])
# Convert list of feature names to pandas column
fi_df['feature'] = pd.____(____)
# Sort the data based on feature importance
fi_df.____(by=[____], ascending=____, inplace=True)
# Inspect Results
fi_df.head(10)