CommencezCommencez gratuitement

Interpréter les résultats

Il est presque toujours important de savoir quelles caractéristiques influencent le plus votre prédiction. Peut-être que c'est contre-intuitif et que cela révèle une piste intéressante? Peut-être qu'une poignée de caractéristiques expliquent l'essentiel de la justesse de votre modèle, et qu'il n'est pas nécessaire d'investir du temps à obtenir ou à retravailler d'autres caractéristiques.

Dans cet exemple, nous allons examiner un modèle qui a été entraîné sans aucune information LISTPRICE. Sans cette donnée, qu'est-ce qui influence le plus le prix?

  • REMARQUE : Le tableau des importances des caractéristiques, importances, a déjà été créé pour vous à partir de model.featureImportances.toArray()

Cette activité fait partie du cours

Ingénierie des caractéristiques avec PySpark

Voir le cours

Instructions de l’exercice

  • Créez un dataframe pandas en utilisant les valeurs de importances et nommez la colonne importance en définissant le paramètre columns.
  • À partir de la liste importée des noms de caractéristiques, feature_cols, créez une nouvelle pandas.Series en l'enveloppant avec la fonction pd.Series(). Affectez-la à la colonne fi_df['feature'].
  • Triez le dataframe avec sort_values(), en définissant le paramètre by sur notre colonne importance et en triant par ordre décroissant avec ascending à False. Examinez les résultats.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Convert feature importances to a pandas column
fi_df = pd.DataFrame(____, columns=[____])

# Convert list of feature names to pandas column
fi_df['feature'] = pd.____(____)

# Sort the data based on feature importance
fi_df.____(by=[____], ascending=____, inplace=True)

# Inspect Results
fi_df.head(10)
Modifier et exécuter le code