베이스라인
적절한 베이스라인과 비교하여 분류기를 평가하는 것은 중요해요. 광고 클릭률과 같은 불균형 데이터셋에서는 다수 클래스를 항상 선택해도 높은 정확도가 쉽게 나올 수 있기 때문에 특히 더 그렇습니다. 이 연습 문제에서는 항상 다수 클래스(비클릭)를 예측하는 베이스라인 분류기를 모의로 만들어 그 혼동 행렬을 확인하고, 정밀도와 재현율이 어떻게 되는지 살펴보겠습니다.
X_train, y_train, X_test, y_test가 작업 공간에 준비되어 있어요. 또한 pandas는 pd, numpy는 np, sklearn도 사용할 수 있어요.
이 연습은 강의의 일부입니다
Python으로 Machine Learning을 활용한 CTR 예측
연습 안내
np.asarray()를 사용해X_test와 길이가 같은 0으로 된 배열y_pred를 만드세요.- 생성된 혼동 행렬을 출력하세요.
- 정밀도와 재현율 점수를 구하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Set up baseline predictions
y_pred = np.____([0 for x in range(len(X_test))])
# Look at confusion matrix
print("Confusion matrix: ")
print(____(y_test, y_pred))
# Check precision and recall
prec = ____(y_test, y_pred, average = 'weighted')
recall = ____(y_test, y_pred, average = 'weighted')
print("Precision: %s, Recall: %s" %(prec, recall))