Заполнение пропущенных значений
В наборе данных Rental Listing Inquiries вы обнаружили, что в столбцах "price" и "building_id" есть пропущенные значения. Прежде чем передавать данные в модели, эти значения необходимо заполнить.
Числовой признак "price" будет заполнен средним значением непропущенных цен.
Заполнять категориальный признак "building_id" наиболее часто встречающейся категорией — плохая идея: это означало бы, что все квартиры с пропущенным "building_id" находятся в самом популярном здании. Лучше заполнить его новой категорией.
DataFrame rental_listings с данными соревнования уже загружен для вас.
Это упражнение является частью курса
Победа в соревновании Kaggle на Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import SimpleImputer
from sklearn.impute import SimpleImputer
# Create mean imputer
mean_imputer = ____(strategy='____')
# Price imputation
rental_listings[['price']] = mean_imputer.____(____[[____]])