ПочатиПочніть безкоштовно

Імпутація пропусків у даних

Ви з'ясували, що в набірі даних Rental Listing Inquiries у стовпцях "price" і "building_id" є пропущені значення. Тому перед передаванням даних у моделі потрібно їх імпутувати.

Числову ознаку "price" закодуємо середнім значенням серед наявних цін.

Імпутувати категоріальну ознаку "building_id" найчастішою категорією — погана ідея, адже це означатиме, що всі квартири з пропущеним "building_id" нібито розташовані в найпопулярнішій будівлі. Краще імпутувати її новою категорією.

Для вас уже зчитано датафрейм rental_listings із даними конкурсу.

Ця вправа є частиною курсу

Як перемагати в змаганнях Kaggle за допомогою Python

Переглянути курс

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import SimpleImputer
from sklearn.impute import SimpleImputer

# Create mean imputer
mean_imputer = ____(strategy='____')

# Price imputation
rental_listings[['price']] = mean_imputer.____(____[[____]])
Редагувати та запускати код