НачатьНачать бесплатно

Обработка выбросов

В предыдущем упражнении вы узнали, как визуализация выбросов может пригодиться на собеседовании по машинному обучению. Ещё один удобный способ обработки выбросов — вычисление Z-оценки, которая задаёт порог для выбросов примерно на уровне ±3 стандартных отклонений от среднего значения.

В этом упражнении вы воспользуетесь модулем scipy.stats, чтобы вычислить Z-оценку с помощью функции stats.zscore(), а также функцией mstats.winsorize() для замены выбросов методом винсоризации.

Вспомните из видеоурока: значения выше и/или ниже 1,5 межквартильного размаха следует рассматривать как возможные выбросы. Для последнего шага этого упражнения такое значение равно 2120.

Необходимые пакеты уже импортированы, а числовые и категориальные столбцы набора данных loan_data выделены и сохранены в переменных numeric_cols и categoric_cols соответственно.

Machine learning pipeline

Это упражнение является частью курса

Практика вопросов интервью по машинному обучению на Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Print: before dropping
print(numeric_cols.mean())
print(numeric_cols.median())
print(numeric_cols.max())

# Create index of rows to keep
idx = (np.____(stats.____(____)) < 3).all(axis=1)

# Concatenate numeric and categoric subsets
ld_out_drop = pd.concat([numeric_cols.loc[____], categoric_cols.loc[____]], axis=1)

# Print: after dropping
print(ld_out_drop.mean())
print(ld_out_drop.median())
print(ld_out_drop.max())
Редактировать и запускать код