开始使用免费开始使用

填补缺失数据

您发现 Rental Listing Inquiries 数据集中的 "price" 和 "building_id" 列存在缺失值。因此,在将数据传递给模型之前,需要对这些值进行填补。

数值特征 "price" 将用非缺失价格的均值进行编码。

将分类特征 "building_id" 用最频繁类别来填补并不好,因为这等于假设所有缺失了 "building_id" 的公寓都位于最热门的楼栋。更好的做法是用一个新的类别来填补。

已为您读取包含比赛数据的 DataFrame rental_listings

本练习是课程的一部分

用 Python 赢下 Kaggle 竞赛

查看课程

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import SimpleImputer
from sklearn.impute import SimpleImputer

# Create mean imputer
mean_imputer = ____(strategy='____')

# Price imputation
rental_listings[['price']] = mean_imputer.____(____[[____]])
编辑并运行代码