정규화 없이 모델링하기
표준화를 먼저 하지 않고 데이터를 바로 모델링하면 정확도가 어떻게 달라질 수 있는지 살펴보겠습니다.
여기에는 wine 데이터셋의 일부가 있습니다. 그중 Proline 열은 다른 열에 비해 분산이 매우 큽니다. 이런 경우에는 로그 정규화 같은 기법이 유용한데, 다음 섹션에서 배울 예정입니다.
지금쯤이면 scikit-learn의 모델 학습 과정이 익숙하실 테니 자세한 설명은 생략하겠습니다. 이미 k-최근접 이웃 모델(knn)과 함께 적합 및 평가에 사용할 X, y 세트가 준비되어 있습니다.
이 연습은 강의의 일부입니다
Python으로 배우는 Machine Learning 전처리
연습 안내
X와y세트를 학습용과 테스트용으로 나누되, 두 세트 모두에서 클래스 레이블 분포가 동일하게 유지되도록 하세요.- 학습용 특성과 레이블에
knn모델을 적합하세요. .score()메서드를 사용해knn모델의 테스트 세트 정확도를 출력하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Split the dataset into training and test sets
X_train, X_test, y_train, y_test = ____(____, ____, stratify=____, random_state=42)
knn = KNeighborsClassifier()
# Fit the knn model to the training data
knn.____(____, ____)
# Score the model on the test data
print(knn.____(____))