KNN-imputering
Datamängder innehåller nästan alltid korrelerade särdrag. Det är därför viktigt att ta hänsyn till dem när man imputerar saknade värden. Maskininlärningsmodeller använder särdragen i DataFrame för att hitta korrelationer och mönster och på så sätt förutsäga ett valt särdrag.
En av de enklaste och mest effektiva modellerna är K Nearest Neighbors. Den hittar de 'K' datapunkter som liknar befintliga datapunkter mest och använder dem för att imputera saknade värden.
I den här övningen har diabetes-DataFrame redan laddats in. Använd paketet fancyimpute för att imputera de saknade värdena i diabetes-DataFrame.
Den här övningen är en del av kursen
Hantera saknade värden i Python
Övningsinstruktioner
- Importera
KNNfrånfancyimpute. - Kopiera
diabetestilldiabetes_knn_imputed. - Skapa ett
KNN()-objekt och tilldela det tillknn_imputer. - Imputera
diabetes_knn_imputed-DataFrame.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import KNN from fancyimpute
___
# Copy diabetes to diabetes_knn_imputed
diabetes_knn_imputed = ___
# Initialize KNN
knn_imputer = ___
# Impute using fit_tranform on diabetes_knn_imputed
diabetes_knn_imputed.iloc[:, :] = ___