开始使用免费开始使用

简单插补

正如您在上一个练习中看到的,直接删除数据可能会让数据集缩减过多。在面试场景中,这会导致机器学习模型产生偏差的结果。

更灵活的做法是对缺失值进行插补。在 Python 中有多种方式可用,在本练习中,您将对 loan_data 使用来自 sklearn.impute 模块的 SimpleImputer() 函数。

随后,您将使用 pandasnumpy 将插补后的数据集转换为一个 DataFrame。

请注意,此时管道中新增了 2 个步骤,InstantiateFitMachine learning pipeline

本练习是课程的一部分

用 Python 练习机器学习面试题

查看课程

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import imputer module
from sklearn.impute import SimpleImputer

# Subset numeric features: numeric_cols
numeric_cols = ____.____(include=[____.____])
编辑并运行代码