시작하기무료로 시작하기

정규화 없이 모델링하기

표준화를 먼저 하지 않고 데이터를 바로 모델링하면 정확도가 어떻게 달라질 수 있는지 살펴보겠습니다.

여기에는 wine 데이터셋의 일부가 있습니다. 그중 Proline 열은 다른 열에 비해 분산이 매우 큽니다. 이런 경우에는 로그 정규화 같은 기법이 유용한데, 다음 섹션에서 배울 예정입니다.

지금쯤이면 scikit-learn의 모델 학습 과정이 익숙하실 테니 자세한 설명은 생략하겠습니다. 이미 k-최근접 이웃 모델(knn)과 함께 적합 및 평가에 사용할 X, y 세트가 준비되어 있습니다.

이 연습은 강의의 일부입니다

Python으로 배우는 Machine Learning 전처리

강의 보기

연습 안내

  • Xy 세트를 학습용과 테스트용으로 나누되, 두 세트 모두에서 클래스 레이블 분포가 동일하게 유지되도록 하세요.
  • 학습용 특성과 레이블에 knn 모델을 적합하세요.
  • .score() 메서드를 사용해 knn 모델의 테스트 세트 정확도를 출력하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Split the dataset into training and test sets
X_train, X_test, y_train, y_test = ____(____, ____, stratify=____, random_state=42)

knn = KNeighborsClassifier()

# Fit the knn model to the training data
knn.____(____, ____)

# Score the model on the test data
print(knn.____(____))
코드 편집 및 실행