Imputacja metodą KNN
Zbiory danych zawierają cechy, które są ze sobą skorelowane. Dlatego warto uwzględniać je przy imputacji brakujących wartości. Modele uczenia maszynowego wykorzystują cechy z ramki danych do wykrywania korelacji i wzorców, a następnie przewidują wartości wybranej cechy.
Jednym z najprostszych i najskuteczniejszych modeli jest algorytm K Najbliższych Sąsiadów (KNN). Wyszukuje on „K" punktów najbardziej podobnych do istniejących obserwacji, aby uzupełnić brakujące wartości.
W tym ćwiczeniu ramka danych diabetes została już wczytana. Użyj pakietu fancyimpute, aby uzupełnić brakujące wartości w ramce danych diabetes.
To ćwiczenie jest częścią kursu
Braki danych w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj
KNNzfancyimpute. - Skopiuj
diabetesdodiabetes_knn_imputed. - Utwórz obiekt
KNN()i przypisz go doknn_imputer. - Wykonaj imputację ramki danych
diabetes_knn_imputed.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import KNN from fancyimpute
___
# Copy diabetes to diabetes_knn_imputed
diabetes_knn_imputed = ___
# Initialize KNN
knn_imputer = ___
# Impute using fit_tranform on diabetes_knn_imputed
diabetes_knn_imputed.iloc[:, :] = ___