학습용과 테스트용으로 데이터 분할
회귀 모델을 구축하기 전 마지막 단계예요! 이번에는 타깃 변수와 특성 열 이름을 확인하고, 해당 데이터를 추출한 뒤 학습용과 테스트용으로 분할해 보겠습니다.
pandas와 numpy 라이브러리는 각각 pd, np로 불러와 두었습니다. 입력 특성은 features 데이터셋으로 제공되며, 이전 연습 문제에서 만들었던 타깃 변수는 Y로 임포트되어 있어요.
이 연습은 강의의 일부입니다
Python으로 배우는 마케팅용 Machine Learning
연습 안내
- 고객 식별자 열 이름을 리스트로 저장하세요.
- 고객 식별자를 제외하고 특성 열 이름을 선택하세요.
- 특성 데이터를
X로 추출하세요. train_test_split()함수를 사용해 데이터를 학습용과 테스트용으로 분할하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Store customer identifier column name as a list
custid = ['___']
# Select feature column names excluding customer identifier
cols = [col for col in features.___ if col not in ___]
# Extract the features as `X`
X = features[___]
# Split data to training and testing
___, test_X, train_Y, ___ = ___(X, Y, test_size=0.25, random_state=99)