Zacznij terazZacznij za darmo

Imputacja metodą KNN

Zbiory danych zawierają cechy, które są ze sobą skorelowane. Dlatego warto uwzględniać je przy imputacji brakujących wartości. Modele uczenia maszynowego wykorzystują cechy z ramki danych do wykrywania korelacji i wzorców, a następnie przewidują wartości wybranej cechy.

Jednym z najprostszych i najskuteczniejszych modeli jest algorytm K Najbliższych Sąsiadów (KNN). Wyszukuje on „K" punktów najbardziej podobnych do istniejących obserwacji, aby uzupełnić brakujące wartości.

W tym ćwiczeniu ramka danych diabetes została już wczytana. Użyj pakietu fancyimpute, aby uzupełnić brakujące wartości w ramce danych diabetes.

To ćwiczenie jest częścią kursu

Braki danych w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj KNN z fancyimpute.
  • Skopiuj diabetes do diabetes_knn_imputed.
  • Utwórz obiekt KNN() i przypisz go do knn_imputer.
  • Wykonaj imputację ramki danych diabetes_knn_imputed.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import KNN from fancyimpute
___

# Copy diabetes to diabetes_knn_imputed
diabetes_knn_imputed = ___

# Initialize KNN
knn_imputer = ___

# Impute using fit_tranform on diabetes_knn_imputed
diabetes_knn_imputed.iloc[:, :] = ___
Edytuj i uruchom kod