НачатьНачать бесплатно

Заполнение пропущенных значений

В наборе данных Rental Listing Inquiries вы обнаружили, что в столбцах "price" и "building_id" есть пропущенные значения. Прежде чем передавать данные в модели, эти значения необходимо заполнить.

Числовой признак "price" будет заполнен средним значением непропущенных цен.

Заполнять категориальный признак "building_id" наиболее часто встречающейся категорией — плохая идея: это означало бы, что все квартиры с пропущенным "building_id" находятся в самом популярном здании. Лучше заполнить его новой категорией.

DataFrame rental_listings с данными соревнования уже загружен для вас.

Это упражнение является частью курса

Победа в соревновании Kaggle на Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import SimpleImputer
from sklearn.impute import SimpleImputer

# Create mean imputer
mean_imputer = ____(strategy='____')

# Price imputation
rental_listings[['price']] = mean_imputer.____(____[[____]])
Редактировать и запускать код