Нормализация
Как было показано в видео, при нормализации все значения столбца линейно масштабируются в диапазон от 0 до 1: 0 соответствует минимальному значению столбца, а 1 — максимальному.
В библиотеке scikit-learn (наиболее популярной библиотеке машинного обучения для Python) для нормализации используется MinMaxScaler.
(Название отражает суть: масштабирование выполняется между минимальным и максимальным значением.)
Это упражнение является частью курса
Конструирование признаков для машинного обучения в Python
Инструкции к упражнению
- Импортируйте
MinMaxScalerиз модуляpreprocessingбиблиотекиsklearn. - Создайте экземпляр
MinMaxScaler()и сохраните его в переменнуюMM_scaler. - Обучите
MinMaxScalerна столбцеAgeнабора данныхso_numeric_df. - Преобразуйте тот же столбец с помощью обученного масштабировщика.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import MinMaxScaler
____
# Instantiate MinMaxScaler
MM_scaler = ____()
# Fit MM_scaler to the data
____.____(so_numeric_df[['Age']])
# Transform the data using the fitted scaler
so_numeric_df['Age_MM'] = ____.____(so_numeric_df[['Age']])
# Compare the origional and transformed column
print(so_numeric_df[['Age_MM', 'Age']].head())