НачатьНачать бесплатно

Простая импутация

Как вы видели в предыдущем упражнении, удаление данных может значительно сократить набор данных. В контексте собеседования это может привести к смещённым результатам модели машинного обучения.

Более гибкий способ работы с пропущенными значениями — импутация. В Python существует несколько подходов к её реализации, однако в этом упражнении вы воспользуетесь функцией SimpleImputer() из модуля sklearn.impute и применёте её к набору данных loan_data.

Затем с помощью pandas и numpy вы преобразуете результат импутации обратно в DataFrame.

Обратите внимание: в конвейер добавлены 2 новых шага — Instantiate и Fit: Machine learning pipeline

Это упражнение является частью курса

Практика вопросов интервью по машинному обучению на Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import imputer module
from sklearn.impute import SimpleImputer

# Subset numeric features: numeric_cols
numeric_cols = ____.____(include=[____.____])
Редактировать и запускать код