Interpréter les résultats
Il est presque toujours important de savoir quelles caractéristiques influencent le plus votre prédiction. Peut-être que c'est contre-intuitif et que cela révèle une piste intéressante? Peut-être qu'une poignée de caractéristiques expliquent l'essentiel de la justesse de votre modèle, et qu'il n'est pas nécessaire d'investir du temps à obtenir ou à retravailler d'autres caractéristiques.
Dans cet exemple, nous allons examiner un modèle qui a été entraîné sans aucune information LISTPRICE. Sans cette donnée, qu'est-ce qui influence le plus le prix?
- REMARQUE : Le tableau des importances des caractéristiques,
importances, a déjà été créé pour vous à partir demodel.featureImportances.toArray()
Cette activité fait partie du cours
Ingénierie des caractéristiques avec PySpark
Instructions de l’exercice
- Créez un dataframe
pandasen utilisant les valeurs deimportanceset nommez la colonneimportanceen définissant le paramètrecolumns. - À partir de la liste importée des noms de caractéristiques,
feature_cols, créez une nouvellepandas.Seriesen l'enveloppant avec la fonctionpd.Series(). Affectez-la à la colonnefi_df['feature']. - Triez le dataframe avec
sort_values(), en définissant le paramètrebysur notre colonneimportanceet en triant par ordre décroissant avecascendingàFalse. Examinez les résultats.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Convert feature importances to a pandas column
fi_df = pd.DataFrame(____, columns=[____])
# Convert list of feature names to pandas column
fi_df['feature'] = pd.____(____)
# Sort the data based on feature importance
fi_df.____(by=[____], ascending=____, inplace=True)
# Inspect Results
fi_df.head(10)