시작하기무료로 시작하기

Machine Learning 모델의 구성 요소 살펴보기

이제 데이터가 모델 성능에 어떤 영향을 미치는지 이해를 강화해 보겠습니다. 파일 booking.csv에 있는 Airbnb 예약 데이터셋을 사용합니다. 이 데이터셋은 누군가 예약을 취소할지를 예측하는 분류 작업에 적합하며, 여러 수치형과 범주형 열을 포함합니다. 제공된 데이터셋을 split_dataset.py 스크립트를 사용해 서로 겹치지 않는 세 개의 샘플인 train_A.csv, train_B.csv, test.csv로 분할합니다. 이후 각 훈련 데이터셋에 대해 데이터 처리와 모델 훈련 파이프라인을 실행해 Random Forest Classifier 모델을 학습하고, model_training.py를 사용해 테스트 세트에서 성능을 평가합니다. params.json에 정의된 하이퍼파라미터는 두 번의 실행에서 동일합니다.

이 Python 스크립트들은 커맨드 라인 인자를 받아 셸에서 실행되도록 설계되어 있습니다. 이해를 깊게 하기 위해 스크립트를 자유롭게 살펴보셔도 됩니다.

이 연습은 강의의 일부입니다

DVC로 배우는 데이터 버저닝 입문

강의 보기

실습형 인터랙티브 연습문제

이론을 실습으로 바꾸는 인터랙티브 연습 중 하나를 만나보세요

연습 시작