Перетворення тренувальних і тестових даних (I)
Досі ви створювали масштабувальники на основі одного стовпця й застосовували їх до тих самих даних, на яких їх було навчено. Під час створення моделей машинного навчання ви зазвичай будуєте моделі на історичних даних (тренувальна вибірка) і застосовуєте їх до нових, раніше не бачених даних (тестова вибірка). У таких випадках потрібно стежити, щоб однакове масштабування застосовувалося і до тренувальних, і до тестових даних.
На практиці для цього ви навчаєте масштабувальник на тренувальній вибірці й зберігаєте його, щоб застосувати до тестової. Ніколи не перенавчайте масштабувальник на тестовій вибірці.
У цій і наступній вправах ми розділили датафрейм so_numeric_df на тренувальну (so_train_numeric) та тестову (so_test_numeric) вибірки.
Ця вправа є частиною курсу
Feature Engineering для машинного навчання в Python
Інструкції до вправи
- Створіть екземпляр
StandardScaler()якSS_scaler. - Навчіть
StandardScalerна стовпціAge. - Трансформуйте стовпець
Ageу тестовій вибірці (so_test_numeric).
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import StandardScaler
from sklearn.preprocessing import StandardScaler
# Apply a standard scaler to the data
SS_scaler = ____
# Fit the standard scaler to the data
____
# Transform the test data using the fitted scaler
so_test_numeric['Age_ss'] = ____
print(so_test_numeric[['Age', 'Age_ss']].head())