简单插补
正如您在上一个练习中看到的,直接删除数据可能会让数据集缩减过多。在面试场景中,这会导致机器学习模型产生偏差的结果。
更灵活的做法是对缺失值进行插补。在 Python 中有多种方式可用,在本练习中,您将对 loan_data 使用来自 sklearn.impute 模块的 SimpleImputer() 函数。
随后,您将使用 pandas 和 numpy 将插补后的数据集转换为一个 DataFrame。
请注意,此时管道中新增了 2 个步骤,Instantiate 和 Fit:

本练习是课程的一部分
用 Python 练习机器学习面试题
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import imputer module
from sklearn.impute import SimpleImputer
# Subset numeric features: numeric_cols
numeric_cols = ____.____(include=[____.____])