KNN 插补
数据集中的特征往往彼此相关。因此,在插补缺失值时考虑相关性非常重要。机器学习模型会利用 DataFrame 中的特征来寻找相关性和模式,并对选定特征进行预测。
一种最简单且高效的模型是 K 近邻(K Nearest Neighbors,KNN)。它会找到与现有数据点最相似的 K 个点来插补缺失值。
本练习中,diabetes DataFrame 已为您加载。请使用 fancyimpute 包对 diabetes DataFrame 中的缺失值进行插补。
本练习是课程的一部分
在 Python 中处理缺失数据
练习说明
- 从
fancyimpute导入KNN。 - 将
diabetes复制为diabetes_knn_imputed。 - 创建一个
KNN()对象并将其赋给knn_imputer。 - 对
diabetes_knn_imputedDataFrame 执行插补。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import KNN from fancyimpute
___
# Copy diabetes to diabetes_knn_imputed
diabetes_knn_imputed = ___
# Initialize KNN
knn_imputer = ___
# Impute using fit_tranform on diabetes_knn_imputed
diabetes_knn_imputed.iloc[:, :] = ___