KNN 插補
資料集通常包含彼此互相關聯的特徵。因此,在插補遺漏值時,把這些關係納入考量很重要。機器學習模型會利用 DataFrame 中的特徵找出關聯與模式,並用來預測某個被選定的特徵。
其中一個最簡單且高效的模型是 K 近鄰(K Nearest Neighbors,KNN)。它會找到與既有資料點最相似的 K 個點,來插補遺漏值。
在這個練習中,diabetes DataFrame 已為你載入。請使用 fancyimpute 套件來為 diabetes DataFrame 插補遺漏值。
本練習屬於課程
在 Python 中處理遺漏值
練習說明
- 從
fancyimpute匯入KNN。 - 將
diabetes複製為diabetes_knn_imputed。 - 建立
KNN()物件並指定為knn_imputer。 - 對
diabetes_knn_imputedDataFrame 進行插補。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Import KNN from fancyimpute
___
# Copy diabetes to diabetes_knn_imputed
diabetes_knn_imputed = ___
# Initialize KNN
knn_imputer = ___
# Impute using fit_tranform on diabetes_knn_imputed
diabetes_knn_imputed.iloc[:, :] = ___