시작하기무료로 시작하기

Train - test split

이번 장에서도 ANSUR 데이터셋을 계속 사용해 보겠습니다. 데이터셋으로 모델을 만들기 전에, 먼저 어떤 피처를 예측할지 결정해야 해요. 여기서는 성별을 예측해 보겠습니다.

이 피처가 들어 있는 열을 데이터셋에서 분리한 다음, 데이터를 학습 세트와 테스트 세트로 나눠야 합니다. 학습 세트는 모델 학습에, 테스트 세트는 보지 못한 데이터에서의 성능을 확인하는 데 사용돼요.

ansur_df는 미리 로드되어 있습니다.

이 연습은 강의의 일부입니다

Python으로 배우는 차원 축소

강의 보기

연습 안내

  • sklearn.model_selection에서 train_test_split 함수를 임포트하세요.
  • 'Gender' 열을 y에 할당하세요.
  • DataFrame에서 'Gender' 열을 제거하고 결과를 X에 할당하세요.
  • 테스트 크기를 30%로 설정하여 학습 70%, 테스트 30%로 나누세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Import train_test_split()
from ____.____ import ____

# Select the Gender column as the feature to be predicted (y)
y = ansur_df[____]

# Remove the Gender column to create the training data
X = ansur_df.____(____, ____)

# Perform a 70% train and 30% test data split
X_train, X_test, y_train, y_test = ____(X, y, ____=____)

print(f"{X_test.shape[0]} rows in test set vs. {X_train.shape[0]} in training set, {X_test.shape[1]} Features.")
코드 편집 및 실행