시작하기무료로 시작하기

Test vs. Train

데이터를 정리하고 모델링할 준비를 마쳤다면, 가장 중요한 단계 중 하나는 데이터를 test settrain set으로 나누는 것입니다. 그다음에는, 좋은 모델이라고 확신하기 전까지 테스트 데이터는 건드리지 마세요! 모델을 만들고 가설을 세우는 동안에는, 학습 데이터로 성능을 확인해 볼 수 있습니다.

마음에 드는 모델이 생기면, 테스트 세트의 새로운 데이터에 대해 얼마나 잘 예측하는지 확인하세요. 한 번도 보지 못한 이 데이터는, 실제 환경에서 새로운 데이터를 예측하거나 분류할 때 모델의 성능을 훨씬 현실적으로 파악하게 해 줍니다.

Spark에서는 모든 변환을 마친 후에 데이터를 분할하는 것이 중요합니다. StringIndexer 같은 연산은 동일한 문자열 목록을 주더라도 항상 같은 인덱스를 만들지 않을 수 있기 때문입니다.

모델 평가에서 테스트 세트를 사용하는 것이 왜 중요할까요?

이 연습은 강의의 일부입니다

PySpark 기초

강의 보기

실습형 인터랙티브 연습문제

이론을 실습으로 바꾸는 인터랙티브 연습 중 하나를 만나보세요

연습 시작