CommencezCommencez gratuitement

Standardisation

La normalisation peut être utile pour ramener une colonne entre deux valeurs, mais il devient difficile de comparer deux colonnes mises à l'échelle si l'une d'elles est fortement influencée par des valeurs aberrantes. Une solution courante est la standardisation : plutôt que de fixer des bornes supérieure et inférieure, on centre les données autour de leur moyenne et on calcule, pour chaque point, le nombre d'écarts-types qui le séparent de la moyenne.

Cette activité fait partie du cours

Ingénierie des caractéristiques pour le Machine Learning en Python

Voir le cours

Instructions de l’exercice

  • Importez StandardScaler du module preprocessing de sklearn.
  • Instanciez StandardScaler() sous le nom SS_scaler.
  • Ajustez le StandardScaler sur la colonne Age de so_numeric_df.
  • Transformez cette même colonne avec l'outil d'échelle que vous venez d'ajuster.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import StandardScaler
____

# Instantiate StandardScaler
SS_scaler = ____()

# Fit SS_scaler to the data
____.____(so_numeric_df[['Age']])

# Transform the data using the fitted scaler
so_numeric_df['Age_SS'] = ____.____(so_numeric_df[['Age']])

# Compare the origional and transformed column
print(so_numeric_df[['Age_SS', 'Age']].head())
Modifier et exécuter le code