Začněte nyníZačněte zdarma

Interpretace výsledků

Téměř vždy je důležité vědět, které příznaky mají na tvůj předpověď největší vliv. Možná je výsledek překvapivý — a to samo o sobě může být cenný poznatek. Nebo možná jen několik příznaků zajišťuje většinu přesnosti modelu a není třeba trávit čas získáváním nebo úpravou těch ostatních.

V tomto příkladu se podíváme na model natrénovaný bez jakýchkoli informací z LISTPRICE. Co tedy nejvíce ovlivňuje cenu?

  • POZNÁMKA: Pole důležitostí příznaků importances už bylo vytvořeno z model.featureImportances.toArray().

Toto cvičení je součástí kurzu

Feature Engineering with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř pandas dataframe s hodnotami z importances a pojmenuj sloupec importance nastavením parametru columns.
  • Pomocí importovaného seznamu názvů příznaků feature_cols vytvoř novou pandas.Series zabalením do funkce pd.Series(). Přiřaď ji ke sloupci fi_df['feature'].
  • Seřaď dataframe pomocí sort_values(), nastav parametr by na náš sloupec importance a řaď sestupně nastavením ascending na False. Prohlédni si výsledky.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Convert feature importances to a pandas column
fi_df = pd.DataFrame(____, columns=[____])

# Convert list of feature names to pandas column
fi_df['feature'] = pd.____(____)

# Sort the data based on feature importance
fi_df.____(by=[____], ascending=____, inplace=True)

# Inspect Results
fi_df.head(10)
Upravit a spustit kód