Перетворення для train і test (II)
Подібно до застосування одного й того самого масштабувача для тренувального й тестового наборів, якщо ви вилучили викиди з train-набору, імовірно, захочете зробити те саме і для test-набору. Знову ж таки, слід переконатися, що для вилучення викидів із тестового набору ви використовуєте порогові значення, обчислені тільки на train-наборі.
Як і в попередній вправі, ми розбили датафрейм so_numeric_df на train (so_train_numeric) і test (so_test_numeric) набори.
Ця вправа є частиною курсу
Feature Engineering для машинного навчання в Python
Інструкції до вправи
- Обчисліть стандартне відхилення та середнє значення стовпця
ConvertedSalary. - Обчисліть верхню та нижню межі як три стандартні відхилення від середнього в обидва боки.
- Обріжте датафрейм
so_test_numeric, щоб залишити лише ті рядки, деConvertedSalaryлежить між нижньою та верхньою межами.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
train_std = so_train_numeric['ConvertedSalary'].____
train_mean = so_train_numeric['ConvertedSalary'].____
cut_off = train_std * 3
train_lower, train_upper = ____, train_mean + cut_off
# Trim the test DataFrame
trimmed_df = so_test_numeric[(so_test_numeric['ConvertedSalary'] < ____) \
& (so_test_numeric['ConvertedSalary'] > ____)]