Ocena klasyfikatora do przewidywania cukrzycy
W tym rozdziale będziesz pracować ze zbiorem danych diabetes_df, który był już wcześniej omawiany.
Celem jest przewidzenie, czy dana osoba prawdopodobnie ma cukrzycę, na podstawie cech: wskaźnika masy ciała (BMI) oraz wieku (w latach). Jest to zatem problem klasyfikacji binarnej. Wartość docelowa 0 oznacza, że osoba nie ma cukrzycy, natomiast wartość 1 oznacza, że osoba cukrzycę ma.
Zbiór danych diabetes_df został wstępnie załadowany jako DataFrame biblioteki pandas i podzielony na X_train, X_test, y_train oraz y_test. Ponadto zainicjowano KNeighborsClassifier() i przypisano go do zmiennej knn.
Dopasuj model do danych treningowych, wykonaj predykcje na zbiorze testowym, a następnie wygeneruj macierz pomyłek i raport klasyfikacji.
To ćwiczenie jest częścią kursu
Nadzorowane uczenie maszynowe z scikit-learn
Instrukcje do ćwiczenia
- Zaimportuj
confusion_matrixiclassification_report. - Dopasuj model do danych treningowych.
- Przewidź etykiety dla zbioru testowego i zapisz wyniki jako
y_pred. - Oblicz i wyświetl macierz pomyłek oraz raport klasyfikacji dla etykiet testowych w porównaniu z przewidywanymi etykietami.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import confusion matrix
____
knn = KNeighborsClassifier(n_neighbors=6)
# Fit the model to the training data
____
# Predict the labels of the test data: y_pred
y_pred = ____
# Generate the confusion matrix and classification report
print(____(____, ____))
print(____(____, ____))