학습 데이터셋 크기 바꾸기
학습 세트와 테스트 세트의 크기는 모델 성능에 영향을 줍니다. 일반적으로 학습 데이터가 많을수록 모델은 더 잘 학습해요. 하지만 학습 데이터에 과적합되어 새로운 데이터에 일반화하지 못할 위험이 있으므로, 모델의 일반화 성능을 제대로 평가하려면 충분한 테스트 데이터가 필요합니다. 따라서 학습에 사용할 양과 테스트로 남겨둘 양 사이에는 중요한 균형과 트레이드오프가 존재합니다.
지금까지는 학습에 70%, 테스트에 30%를 사용했습니다. 이제 학습에 80%를 사용해 보고, 그것이 모델 성능에 어떤 변화를 주는지 평가해 봅시다.
이 연습은 강의의 일부입니다
마케팅 애널리틱스: Python으로 고객 이탈 예측하기
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Import train_test_split
from sklearn.model_selection import train_test_split
# Create feature variable
X = telco.drop('Churn', axis=1)
# Create target variable
y = telco['Churn']
# Create training and testing sets
X_train, X_test, y_train, y_test = ____