Імпутація KNN
У наборах даних завжди є ознаки, які корелюють між собою. Тому важливо враховувати їх як чинник під час заповнення пропусків. Моделі машинного навчання використовують ознаки в датафреймі, щоб знаходити кореляції та закономірності й передбачати обрану ознаку.
Одна з найпростіших і водночас ефективних моделей — K найближчих сусідів (K Nearest Neighbors). Вона знаходить «K» точок, найбільш подібних до наявних спостережень, щоб імпутувати пропущені значення.
У цій вправі датафрейм diabetes уже завантажено для вас. Використайте пакет fancyimpute, щоб імпутувати пропущені значення в датафреймі diabetes.
Ця вправа є частиною курсу
Робота з пропущеними даними в Python
Інструкції до вправи
- Імпортуйте
KNNзfancyimpute. - Скопіюйте
diabetesуdiabetes_knn_imputed. - Створіть об'єкт
KNN()і присвойте його зміннійknn_imputer. - Імпутуйте датафрейм
diabetes_knn_imputed.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import KNN from fancyimpute
___
# Copy diabetes to diabetes_knn_imputed
diabetes_knn_imputed = ___
# Initialize KNN
knn_imputer = ___
# Impute using fit_tranform on diabetes_knn_imputed
diabetes_knn_imputed.iloc[:, :] = ___