학습용과 테스트용으로 분할하기
이제 데이터프레임이 준비되었으니, 표준 모델링 기법을 적용할 수 있어요. 이 연습 문제에서는 데이터를 학습용 세트와 테스트용 세트로 나누겠습니다.
이 연습은 강의의 일부입니다
R로 배우는 네트워크 데이터 기반 Predictive Analytics
연습 안내
- 결과 재현성을 위해
set.seed()를 사용하여 시드를 7로 설정하세요. sample()함수를 사용해studentnetworkdata의 전체 행 수 범위에서 생성한 수열 중 3분의 2를 추출하세요. 이 벡터의 이름은index_train으로 지정하세요.index_train에 저장된 행을 포함하여studentnetworkdata에서 학습용 세트를 만들고, 이름을training_set으로 지정하세요.index_train에 저장된 행을 제외하여studentnetworkdata에서 테스트용 세트를 만들고, 이름을test_set으로 지정하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Set the seed
set.seed(___)
# Creat the index vector
index_train <- sample(1:nrow(___), 2 / 3 * nrow(___))
# Make the training set
training_set <- ___[index_train,]
# Make the test set
___ <- ___[-index_train,]