Imputación con KNN
Los conjuntos de datos suelen tener variables correlacionadas. Por eso es importante tenerlas en cuenta a la hora de imputar valores faltantes. Los modelos de Machine Learning usan las variables del DataFrame para encontrar correlaciones y patrones y predecir una variable seleccionada.
Uno de los modelos más simples y eficientes es K Nearest Neighbors. Busca los 'K' puntos más similares a los puntos de datos existentes para imputar los valores faltantes.
En este ejercicio, el DataFrame diabetes ya está cargado. Usa el paquete fancyimpute para imputar los valores faltantes en el DataFrame diabetes.
Este ejercicio forma parte del curso
Cómo tratar datos faltantes en Python
Instrucciones del ejercicio
- Importa
KNNdefancyimpute. - Copia
diabetesendiabetes_knn_imputed. - Crea un objeto
KNN()y asígnalo aknn_imputer. - Imputa el DataFrame
diabetes_knn_imputed.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Import KNN from fancyimpute
___
# Copy diabetes to diabetes_knn_imputed
diabetes_knn_imputed = ___
# Initialize KNN
knn_imputer = ___
# Impute using fit_tranform on diabetes_knn_imputed
diabetes_knn_imputed.iloc[:, :] = ___