Импутация методом KNN
В наборах данных признаки, как правило, взаимосвязаны. Поэтому при заполнении пропущенных значений важно учитывать эти зависимости. Модели машинного обучения анализируют признаки в DataFrame, выявляют корреляции и закономерности, а затем предсказывают значения выбранного признака.
Одной из наиболее простых и эффективных моделей является метод K ближайших соседей (KNN). Он находит «K» точек, наиболее похожих на имеющиеся, и использует их для заполнения пропусков.
В этом упражнении DataFrame diabetes уже загружен. Используйте пакет fancyimpute, чтобы заполнить пропущенные значения в DataFrame diabetes.
Это упражнение является частью курса
Работа с пропущенными данными в Python
Инструкции к упражнению
- Импортируйте
KNNизfancyimpute. - Скопируйте
diabetesвdiabetes_knn_imputed. - Создайте объект
KNN()и присвойте его переменнойknn_imputer. - Выполните импутацию DataFrame
diabetes_knn_imputed.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import KNN from fancyimpute
___
# Copy diabetes to diabetes_knn_imputed
diabetes_knn_imputed = ___
# Initialize KNN
knn_imputer = ___
# Impute using fit_tranform on diabetes_knn_imputed
diabetes_knn_imputed.iloc[:, :] = ___