ÎncepețiÎncepe gratuit

Interpretarea rezultatelor

Este aproape întotdeauna important să știi care caracteristici influențează cel mai mult predicțiile modelului tău. Poate că rezultatul este contraintuitiv – și tocmai acesta poate fi un insight valoros! Sau poate că doar câteva caracteristici răspund pentru cea mai mare parte din acuratețea modelului, iar celelalte nu mai merită efortul de colectare sau prelucrare.

În acest exemplu vom analiza un model antrenat fără nicio informație despre LISTPRICE. Fără aceasta, ce influențează cel mai mult prețul?

  • NOTĂ: Vectorul importanțelor caracteristicilor, importances, a fost deja creat pentru tine din model.featureImportances.toArray()

Acest exercițiu face parte din cursul

Feature Engineering cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează un dataframe pandas folosind valorile din importances și denumește coloana importance prin setarea parametrului columns.
  • Folosind lista importată de nume de caracteristici, feature_cols, creează o nouă pandas.Series înfășurând-o în funcția pd.Series(). Atribuie rezultatul coloanei fi_df['feature'].
  • Sortează dataframe-ul folosind sort_values(), setând parametrul by la coloana importance și sortând descrescător prin setarea ascending la False. Inspectează rezultatele.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Convert feature importances to a pandas column
fi_df = pd.DataFrame(____, columns=[____])

# Convert list of feature names to pandas column
fi_df['feature'] = pd.____(____)

# Sort the data based on feature importance
fi_df.____(by=[____], ascending=____, inplace=True)

# Inspect Results
fi_df.head(10)
Editează și rulează codul