ПочатиПочніть безкоштовно

Імпутація KNN

У наборах даних завжди є ознаки, які корелюють між собою. Тому важливо враховувати їх як чинник під час заповнення пропусків. Моделі машинного навчання використовують ознаки в датафреймі, щоб знаходити кореляції та закономірності й передбачати обрану ознаку.

Одна з найпростіших і водночас ефективних моделей — K найближчих сусідів (K Nearest Neighbors). Вона знаходить «K» точок, найбільш подібних до наявних спостережень, щоб імпутувати пропущені значення.

У цій вправі датафрейм diabetes уже завантажено для вас. Використайте пакет fancyimpute, щоб імпутувати пропущені значення в датафреймі diabetes.

Ця вправа є частиною курсу

Робота з пропущеними даними в Python

Переглянути курс

Інструкції до вправи

  • Імпортуйте KNN з fancyimpute.
  • Скопіюйте diabetes у diabetes_knn_imputed.
  • Створіть об'єкт KNN() і присвойте його змінній knn_imputer.
  • Імпутуйте датафрейм diabetes_knn_imputed.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import KNN from fancyimpute
___

# Copy diabetes to diabetes_knn_imputed
diabetes_knn_imputed = ___

# Initialize KNN
knn_imputer = ___

# Impute using fit_tranform on diabetes_knn_imputed
diabetes_knn_imputed.iloc[:, :] = ___
Редагувати та запускати код