CommencezCommencez gratuitement

À quoi ressemblent vos données? (I)

Jusqu'ici, vous vous êtes concentré sur la création de nouvelles caractéristiques et la gestion des problèmes dans vos données. L'ingénierie des caractéristiques peut aussi servir à tirer le maximum des données que vous avez déjà et à les utiliser plus efficacement lors de la création de modèles de Machine Learning.
Beaucoup d'algorithmes supposent que vos données suivent une loi normale, ou du moins que toutes vos colonnes sont sur la même échelle. Ce n'est souvent pas le cas : par exemple, une caractéristique peut être mesurée en milliers de dollars, tandis qu'une autre correspond au nombre d'années. Dans cet exercice, vous allez créer des graphiques pour examiner la distribution de certaines colonnes numériques du DataFrame so_survey_df, stockées dans so_numeric_df.

Cette activité fait partie du cours

Ingénierie des caractéristiques pour le Machine Learning en Python

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create a histogram
____
plt.show()
Modifier et exécuter le code