Імпутація пропусків у даних
Ви з'ясували, що в набірі даних Rental Listing Inquiries у стовпцях "price" і "building_id" є пропущені значення. Тому перед передаванням даних у моделі потрібно їх імпутувати.
Числову ознаку "price" закодуємо середнім значенням серед наявних цін.
Імпутувати категоріальну ознаку "building_id" найчастішою категорією — погана ідея, адже це означатиме, що всі квартири з пропущеним "building_id" нібито розташовані в найпопулярнішій будівлі. Краще імпутувати її новою категорією.
Для вас уже зчитано датафрейм rental_listings із даними конкурсу.
Ця вправа є частиною курсу
Як перемагати в змаганнях Kaggle за допомогою Python
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import SimpleImputer
from sklearn.impute import SimpleImputer
# Create mean imputer
mean_imputer = ____(strategy='____')
# Price imputation
rental_listings[['price']] = mean_imputer.____(____[[____]])