НачатьНачать бесплатно

Импутация методом KNN

В наборах данных признаки, как правило, взаимосвязаны. Поэтому при заполнении пропущенных значений важно учитывать эти зависимости. Модели машинного обучения анализируют признаки в DataFrame, выявляют корреляции и закономерности, а затем предсказывают значения выбранного признака.

Одной из наиболее простых и эффективных моделей является метод K ближайших соседей (KNN). Он находит «K» точек, наиболее похожих на имеющиеся, и использует их для заполнения пропусков.

В этом упражнении DataFrame diabetes уже загружен. Используйте пакет fancyimpute, чтобы заполнить пропущенные значения в DataFrame diabetes.

Это упражнение является частью курса

Работа с пропущенными данными в Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте KNN из fancyimpute.
  • Скопируйте diabetes в diabetes_knn_imputed.
  • Создайте объект KNN() и присвойте его переменной knn_imputer.
  • Выполните импутацию DataFrame diabetes_knn_imputed.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import KNN from fancyimpute
___

# Copy diabetes to diabetes_knn_imputed
diabetes_knn_imputed = ___

# Initialize KNN
knn_imputer = ___

# Impute using fit_tranform on diabetes_knn_imputed
diabetes_knn_imputed.iloc[:, :] = ___
Редактировать и запускать код