시작하기무료로 시작하기

학습용과 테스트용으로 데이터 분할

회귀 모델을 구축하기 전 마지막 단계예요! 이번에는 타깃 변수와 특성 열 이름을 확인하고, 해당 데이터를 추출한 뒤 학습용과 테스트용으로 분할해 보겠습니다.

pandasnumpy 라이브러리는 각각 pd, np로 불러와 두었습니다. 입력 특성은 features 데이터셋으로 제공되며, 이전 연습 문제에서 만들었던 타깃 변수는 Y로 임포트되어 있어요.

이 연습은 강의의 일부입니다

Python으로 배우는 마케팅용 Machine Learning

강의 보기

연습 안내

  • 고객 식별자 열 이름을 리스트로 저장하세요.
  • 고객 식별자를 제외하고 특성 열 이름을 선택하세요.
  • 특성 데이터를 X로 추출하세요.
  • train_test_split() 함수를 사용해 데이터를 학습용과 테스트용으로 분할하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Store customer identifier column name as a list
custid = ['___']

# Select feature column names excluding customer identifier
cols = [col for col in features.___ if col not in ___]

# Extract the features as `X`
X = features[___]

# Split data to training and testing
___, test_X, train_Y, ___ = ___(X, Y, test_size=0.25, random_state=99)
코드 편집 및 실행