Machine Learning 모델의 구성 요소 살펴보기
이제 데이터가 모델 성능에 어떤 영향을 미치는지 이해를 강화해 보겠습니다. 파일 booking.csv에 있는 Airbnb 예약 데이터셋을 사용합니다. 이 데이터셋은 누군가 예약을 취소할지를 예측하는 분류 작업에 적합하며, 여러 수치형과 범주형 열을 포함합니다.
제공된 데이터셋을 split_dataset.py 스크립트를 사용해 서로 겹치지 않는 세 개의 샘플인 train_A.csv, train_B.csv, test.csv로 분할합니다. 이후 각 훈련 데이터셋에 대해 데이터 처리와 모델 훈련 파이프라인을 실행해 Random Forest Classifier 모델을 학습하고, model_training.py를 사용해 테스트 세트에서 성능을 평가합니다. params.json에 정의된 하이퍼파라미터는 두 번의 실행에서 동일합니다.
이 Python 스크립트들은 커맨드 라인 인자를 받아 셸에서 실행되도록 설계되어 있습니다. 이해를 깊게 하기 위해 스크립트를 자유롭게 살펴보셔도 됩니다.
이 연습은 강의의 일부입니다
