Стандартизація
Нормалізація корисна, коли потрібно масштабувати стовпчик між двома значеннями. Однак порівнювати два масштабовані стовпчики складно, якщо хоча б один із них надто чутливий до викидів. Поширене рішення — стандартизація: замість жорстких верхньої та нижньої меж дані центрують відносно середнього та виражають кожне значення як кількість стандартних відхилень від цього середнього.
Ця вправа є частиною курсу
Feature Engineering для машинного навчання в Python
Інструкції до вправи
- Імпортуйте
StandardScalerз модуляpreprocessingбібліотекиsklearn. - Створіть екземпляр
StandardScaler()якSS_scaler. - Навчіть (
fit)StandardScalerна стовпчикуAgeдатафреймаso_numeric_df. - Перетворіть (
transform) цей самий стовпчик за допомогою щойно навченого перетворювача.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import StandardScaler
____
# Instantiate StandardScaler
SS_scaler = ____()
# Fit SS_scaler to the data
____.____(so_numeric_df[['Age']])
# Transform the data using the fitted scaler
so_numeric_df['Age_SS'] = ____.____(so_numeric_df[['Age']])
# Compare the origional and transformed column
print(so_numeric_df[['Age_SS', 'Age']].head())