填补缺失数据
您发现 Rental Listing Inquiries 数据集中的 "price" 和 "building_id" 列存在缺失值。因此,在将数据传递给模型之前,需要对这些值进行填补。
数值特征 "price" 将用非缺失价格的均值进行编码。
将分类特征 "building_id" 用最频繁类别来填补并不好,因为这等于假设所有缺失了 "building_id" 的公寓都位于最热门的楼栋。更好的做法是用一个新的类别来填补。
已为您读取包含比赛数据的 DataFrame rental_listings。
本练习是课程的一部分
用 Python 赢下 Kaggle 竞赛
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import SimpleImputer
from sklearn.impute import SimpleImputer
# Create mean imputer
mean_imputer = ____(strategy='____')
# Price imputation
rental_listings[['price']] = mean_imputer.____(____[[____]])