ПочатиПочніть безкоштовно

Перетворення для train і test (II)

Подібно до застосування одного й того самого масштабувача для тренувального й тестового наборів, якщо ви вилучили викиди з train-набору, імовірно, захочете зробити те саме і для test-набору. Знову ж таки, слід переконатися, що для вилучення викидів із тестового набору ви використовуєте порогові значення, обчислені тільки на train-наборі.

Як і в попередній вправі, ми розбили датафрейм so_numeric_df на train (so_train_numeric) і test (so_test_numeric) набори.

Ця вправа є частиною курсу

Feature Engineering для машинного навчання в Python

Переглянути курс

Інструкції до вправи

  • Обчисліть стандартне відхилення та середнє значення стовпця ConvertedSalary.
  • Обчисліть верхню та нижню межі як три стандартні відхилення від середнього в обидва боки.
  • Обріжте датафрейм so_test_numeric, щоб залишити лише ті рядки, де ConvertedSalary лежить між нижньою та верхньою межами.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

train_std = so_train_numeric['ConvertedSalary'].____
train_mean = so_train_numeric['ConvertedSalary'].____

cut_off = train_std * 3
train_lower, train_upper = ____, train_mean + cut_off

# Trim the test DataFrame
trimmed_df = so_test_numeric[(so_test_numeric['ConvertedSalary'] < ____) \
                             & (so_test_numeric['ConvertedSalary'] > ____)]
Редагувати та запускати код