데이터 분할하기
이 연습 문제에서는 caret 패키지를 사용해 데이터를 학습 세트와 테스트 세트로 분할합니다. 다음 레슨에서는 학습 세트로 로지스틱 회귀 모델을 만들고, 테스트 세트로 해당 모델을 검증할 거예요.
이 연습은 강의의 일부입니다
HR Analytics: R로 직원 이탈 예측하기
연습 안내
caret패키지를 불러오세요.- 시드를 567로 설정하고, 데이터셋
emp_final을 학습/테스트 70%/30%로 나누는 데이터 분할을 생성하세요. - 데이터셋
emp_final에서index_train에 저장된 행 번호를 선택해 학습용 데이터셋을 만드세요. emp_final의 나머지 관측값을 테스트 세트에 할당하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Load caret
___
# Set seed of 567
___
# Store row numbers for training dataset: index_train
index_train <- ___(emp_final$turnover, p = ___, list = FALSE)
# Create training dataset: train_set
train_set <- emp_final[___, ]
# Create testing dataset: test_set
test_set <- emp_final[___, ]