НачатьНачать бесплатно

Стандартизация

Нормализация удобна для масштабирования столбца в заданном диапазоне значений, однако сравнивать два нормализованных столбца сложно, если хотя бы один из них сильно подвержен влиянию выбросов. Распространённое решение этой проблемы — стандартизация. В отличие от нормализации, она не задаёт жёстких границ: данные центрируются относительно среднего значения, а каждая точка выражается как количество стандартных отклонений от этого среднего.

Это упражнение является частью курса

Конструирование признаков для машинного обучения в Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте StandardScaler из модуля preprocessing библиотеки sklearn.
  • Создайте экземпляр StandardScaler() и назовите его SS_scaler.
  • Обучите StandardScaler на столбце Age набора данных so_numeric_df.
  • Преобразуйте тот же столбец с помощью обученного масштабировщика.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import StandardScaler
____

# Instantiate StandardScaler
SS_scaler = ____()

# Fit SS_scaler to the data
____.____(so_numeric_df[['Age']])

# Transform the data using the fitted scaler
so_numeric_df['Age_SS'] = ____.____(so_numeric_df[['Age']])

# Compare the origional and transformed column
print(so_numeric_df[['Age_SS', 'Age']].head())
Редактировать и запускать код