ПочатиПочніть безкоштовно

Перетворення тренувальних і тестових даних (I)

Досі ви створювали масштабувальники на основі одного стовпця й застосовували їх до тих самих даних, на яких їх було навчено. Під час створення моделей машинного навчання ви зазвичай будуєте моделі на історичних даних (тренувальна вибірка) і застосовуєте їх до нових, раніше не бачених даних (тестова вибірка). У таких випадках потрібно стежити, щоб однакове масштабування застосовувалося і до тренувальних, і до тестових даних.
На практиці для цього ви навчаєте масштабувальник на тренувальній вибірці й зберігаєте його, щоб застосувати до тестової. Ніколи не перенавчайте масштабувальник на тестовій вибірці.

У цій і наступній вправах ми розділили датафрейм so_numeric_df на тренувальну (so_train_numeric) та тестову (so_test_numeric) вибірки.

Ця вправа є частиною курсу

Feature Engineering для машинного навчання в Python

Переглянути курс

Інструкції до вправи

  • Створіть екземпляр StandardScaler() як SS_scaler.
  • Навчіть StandardScaler на стовпці Age.
  • Трансформуйте стовпець Age у тестовій вибірці (so_test_numeric).

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import StandardScaler
from sklearn.preprocessing import StandardScaler

# Apply a standard scaler to the data
SS_scaler = ____

# Fit the standard scaler to the data
____

# Transform the test data using the fitted scaler
so_test_numeric['Age_ss'] = ____
print(so_test_numeric[['Age', 'Age_ss']].head())
Редагувати та запускати код