KNN による代入
データセットには相関のある特徴量が必ず含まれます。したがって、欠損値を補完(代入)するときには、それらを要因として考慮することが重要です。Machine Learning のモデルは、DataFrame 内の特徴量を使って相関やパターンを見つけ、選んだ特徴量を予測します。
最もシンプルで効率的なモデルの1つが K Nearest Neighbors です。既存のデータ点に最も似ている「K」個の点を見つけて、欠損値を代入します。
この演習では、diabetes DataFrame はすでに読み込まれています。fancyimpute パッケージを使って、diabetes DataFrame の欠損値を代入してください。
この演習はコースの一部です
Pythonで欠損データに対処する
演習の手順
fancyimputeからKNNをインポートします。diabetesをdiabetes_knn_imputedにコピーします。KNN()オブジェクトを作成し、knn_imputerに代入します。diabetes_knn_imputedDataFrame を代入(impute)します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import KNN from fancyimpute
___
# Copy diabetes to diabetes_knn_imputed
diabetes_knn_imputed = ___
# Initialize KNN
knn_imputer = ___
# Impute using fit_tranform on diabetes_knn_imputed
diabetes_knn_imputed.iloc[:, :] = ___