KNN-Imputation
Datensätze enthalten oft Merkmale, die miteinander korreliert sind. Deshalb ist es wichtig, diese Korrelationen beim Imputieren fehlender Werte zu berücksichtigen. Machine-Learning-Modelle nutzen die Features im DataFrame, um Zusammenhänge und Muster zu finden und ein ausgewähltes Feature vorherzusagen.
Eines der einfachsten und effizientesten Modelle ist K Nearest Neighbors. Dabei werden die „K“ Datenpunkte gesucht, die den vorhandenen Punkten am ähnlichsten sind, um fehlende Werte zu imputieren.
In dieser Übung wurde der DataFrame diabetes bereits für dich geladen. Verwende das Paket fancyimpute, um die fehlenden Werte im DataFrame diabetes zu imputieren.
Diese Übung ist Teil des Kurses
<Kurs>Umgang mit fehlenden Daten in Python</Kurs>Übungsanweisungen
- Importiere
KNNausfancyimpute. - Kopiere
diabetesnachdiabetes_knn_imputed. - Erstelle ein
KNN()-Objekt und weise esknn_imputerzu. - Imputiere den DataFrame
diabetes_knn_imputed.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Import KNN from fancyimpute
___
# Copy diabetes to diabetes_knn_imputed
diabetes_knn_imputed = ___
# Initialize KNN
knn_imputer = ___
# Impute using fit_tranform on diabetes_knn_imputed
diabetes_knn_imputed.iloc[:, :] = ___