Standardisation
La normalisation peut être utile pour ramener une colonne entre deux valeurs, mais il devient difficile de comparer deux colonnes mises à l'échelle si l'une d'elles est fortement influencée par des valeurs aberrantes. Une solution courante est la standardisation : plutôt que de fixer des bornes supérieure et inférieure, on centre les données autour de leur moyenne et on calcule, pour chaque point, le nombre d'écarts-types qui le séparent de la moyenne.
Cette activité fait partie du cours
Ingénierie des caractéristiques pour le Machine Learning en Python
Instructions de l’exercice
- Importez
StandardScalerdu modulepreprocessingdesklearn. - Instanciez
StandardScaler()sous le nomSS_scaler. - Ajustez le
StandardScalersur la colonneAgedeso_numeric_df. - Transformez cette même colonne avec l'outil d'échelle que vous venez d'ajuster.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import StandardScaler
____
# Instantiate StandardScaler
SS_scaler = ____()
# Fit SS_scaler to the data
____.____(so_numeric_df[['Age']])
# Transform the data using the fitted scaler
so_numeric_df['Age_SS'] = ____.____(so_numeric_df[['Age']])
# Compare the origional and transformed column
print(so_numeric_df[['Age_SS', 'Age']].head())