당뇨병 예측 분류기 평가하기
이 챕터에서는 이전에 소개된 diabetes_df 데이터세트로 작업할 것입니다.
목표는 체질량지수(BMI)와 나이(세)라는 특성을 기반으로 각 개인이 당뇨병을 가질 가능성이 있는지 여부를 예측하는 것입니다. 즉, 이진 분류 문제입니다. 타깃 값 0은 해당 개인이 당뇨병이 없음을 나타내며, 값 1은 해당 개인이 당뇨병이 있음을 나타냅니다.
diabetes_df는 pandas DataFrame으로 미리 로드되어 X_train, X_test, y_train, y_test로 분할되어 있습니다. 또한 KNeighborsClassifier()가 인스턴스화되어 knn에 할당되었습니다.
모델을 학습시키고, 테스트 세트에서 예측을 수행한 수, 혼동 행렬과 분류 보고서를 생성하세요.
이 연습은 강의의 일부입니다
scikit-learn으로 배우는 지도 학습
연습 안내
confusion_matrix와classification_report를 가져오세요.- 모델을 학습 데이터에 학습시키세요.
- 테스트 세트의 레이블을 예측하고, 결과를
y_pred로 저장하세요. - 테스트 레이블 대 예측 레이블에 대한 혼동 행렬과 분류 보고서를 계산하고 출력하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Import confusion matrix
____
knn = KNeighborsClassifier(n_neighbors=6)
# Fit the model to the training data
____
# Predict the labels of the test data: y_pred
y_pred = ____
# Generate the confusion matrix and classification report
print(____(____, ____))
print(____(____, ____))