Преобразования на обучающей и тестовой выборках (II)
Как и при применении одного и того же масштабировщика к обучающей и тестовой выборкам, если вы удалили выбросы из обучающей выборки, то же самое следует сделать и с тестовой. При этом важно использовать пороговые значения, рассчитанные исключительно на обучающей выборке, чтобы удалить выбросы из тестовой выборки.
Как и в предыдущем упражнении, DataFrame so_numeric_df уже разделён на обучающую (so_train_numeric) и тестовую (so_test_numeric) выборки.
Это упражнение является частью курса
Конструирование признаков для машинного обучения в Python
Инструкции к упражнению
- Вычислите стандартное отклонение и среднее значение столбца
ConvertedSalary. - Рассчитайте верхнюю и нижнюю границы как три стандартных отклонения от среднего в обоих направлениях.
- Отфильтруйте DataFrame
so_test_numeric, оставив только те строки, в которых значениеConvertedSalaryнаходится в пределах нижней и верхней границ.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
train_std = so_train_numeric['ConvertedSalary'].____
train_mean = so_train_numeric['ConvertedSalary'].____
cut_off = train_std * 3
train_lower, train_upper = ____, train_mean + cut_off
# Trim the test DataFrame
trimmed_df = so_test_numeric[(so_test_numeric['ConvertedSalary'] < ____) \
& (so_test_numeric['ConvertedSalary'] > ____)]