Podział na zbiór treningowy i testowy
Teraz, gdy mamy już ramkę danych, możemy zastosować standardowe techniki modelowania. W tym ćwiczeniu podzielisz dane na zbiór treningowy i zbiór testowy.
To ćwiczenie jest częścią kursu
Predykcyjna analityka sieciowa w R
Instrukcje do ćwiczenia
- Aby zapewnić odtwarzalność wyników, ustaw ziarno losowości na 7, używając funkcji
set.seed(). - Użyj funkcji
sample(), aby wylosować dwie trzecie liczb z zakresu odpowiadającego łącznej liczbie wierszy w zbiorzestudentnetworkdata. Zapisz ten wektor pod nazwąindex_train. - Utwórz zbiór treningowy, wybierając wiersze ze zbioru
studentnetworkdatao indeksach zapisanych windex_train, i nadaj mu nazwętraining_set. - Utwórz zbiór testowy, wykluczając wiersze ze zbioru
studentnetworkdatao indeksach zapisanych windex_train, i nadaj mu nazwętest_set.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Set the seed
set.seed(___)
# Creat the index vector
index_train <- sample(1:nrow(___), 2 / 3 * nrow(___))
# Make the training set
training_set <- ___[index_train,]
# Make the test set
___ <- ___[-index_train,]