НачатьНачать бесплатно

Преобразования на обучающей и тестовой выборках (II)

Как и при применении одного и того же масштабировщика к обучающей и тестовой выборкам, если вы удалили выбросы из обучающей выборки, то же самое следует сделать и с тестовой. При этом важно использовать пороговые значения, рассчитанные исключительно на обучающей выборке, чтобы удалить выбросы из тестовой выборки.

Как и в предыдущем упражнении, DataFrame so_numeric_df уже разделён на обучающую (so_train_numeric) и тестовую (so_test_numeric) выборки.

Это упражнение является частью курса

Конструирование признаков для машинного обучения в Python

Посмотреть курс

Инструкции к упражнению

  • Вычислите стандартное отклонение и среднее значение столбца ConvertedSalary.
  • Рассчитайте верхнюю и нижнюю границы как три стандартных отклонения от среднего в обоих направлениях.
  • Отфильтруйте DataFrame so_test_numeric, оставив только те строки, в которых значение ConvertedSalary находится в пределах нижней и верхней границ.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

train_std = so_train_numeric['ConvertedSalary'].____
train_mean = so_train_numeric['ConvertedSalary'].____

cut_off = train_std * 3
train_lower, train_upper = ____, train_mean + cut_off

# Trim the test DataFrame
trimmed_df = so_test_numeric[(so_test_numeric['ConvertedSalary'] < ____) \
                             & (so_test_numeric['ConvertedSalary'] > ____)]
Редактировать и запускать код