Hodnocení klasifikátoru pro předpověď diabetu
V této kapitole budeš pracovat s datasetem diabetes_df, který jsme představili dříve.
Cílem je předpovědět, zda má daný jedinec pravděpodobně diabetes, a to na základě příznaků index tělesné hmotnosti (BMI) a věk (v letech). Jde tedy o binární klasifikační problém. Cílová hodnota 0 znamená, že daný jedinec diabetes nemá, zatímco hodnota 1 znamená, že diabetes má.
diabetes_df je pro tebe předem načten jako pandas DataFrame a rozdělen na X_train, X_test, y_train a y_test. Navíc byl vytvořen objekt KNeighborsClassifier() a přiřazen do proměnné knn.
Natrénuješ model, provedeš predikce na testovací sadě a pak vytvoříš matici záměn a klasifikační zprávu.
Toto cvičení je součástí kurzu
Supervised Learning with scikit-learn
Pokyny k cvičení
- Importuj
confusion_matrixaclassification_report. - Natrénuj model na trénovacích datech.
- Predikuj štítky testovací sady a výsledky ulož do proměnné
y_pred. - Vypočítej a vypiš matici záměn a klasifikační zprávu pro testovací štítky v porovnání s predikovanými štítky.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import confusion matrix
____
knn = KNeighborsClassifier(n_neighbors=6)
# Fit the model to the training data
____
# Predict the labels of the test data: y_pred
y_pred = ____
# Generate the confusion matrix and classification report
print(____(____, ____))
print(____(____, ____))