Оценка классификатора для предсказания диабета
В этой главе вы будете работать с набором данных diabetes_df, с которым уже знакомились ранее.
Цель — предсказать, есть ли у каждого пациента диабет, на основе двух признаков: индекса массы тела (ИМТ) и возраста (в годах). Это задача бинарной классификации. Значение целевой переменной 0 означает, что у пациента диабета нет, а значение 1 — что диабет есть.
Набор данных diabetes_df уже загружен как DataFrame библиотеки pandas и разделён на X_train, X_test, y_train и y_test. Кроме того, создан и присвоен переменной knn экземпляр KNeighborsClassifier().
Вам нужно обучить модель, получить предсказания на тестовой выборке, а затем построить матрицу ошибок и отчёт по классификации.
Это упражнение является частью курса
Обучение с учителем с помощью scikit-learn
Инструкции к упражнению
- Импортируйте
confusion_matrixиclassification_report. - Обучите модель на обучающих данных.
- Предскажите метки тестовой выборки и сохраните результат в переменную
y_pred. - Вычислите и выведите матрицу ошибок и отчёт по классификации для тестовых меток и предсказанных меток.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import confusion matrix
____
knn = KNeighborsClassifier(n_neighbors=6)
# Fit the model to the training data
____
# Predict the labels of the test data: y_pred
y_pred = ____
# Generate the confusion matrix and classification report
print(____(____, ____))
print(____(____, ____))