Rozdělení na trénovací a testovací sadu
Teď, když máme dataframe, můžeme použít standardní techniky modelování. V tomto cvičení rozdělíš data na trénovací a testovací sadu.
Toto cvičení je součástí kurzu
Prediktivní analytika pomocí síťových dat v R
Pokyny k cvičení
- Aby byly tvoje výsledky reprodukovatelné, nastav seed na hodnotu 7 pomocí
set.seed(). - Pomocí funkce
sample()vyber náhodně dvě třetiny čísel z rozsahu celkového počtu řádků vstudentnetworkdata. Tento vektor pojmenujindex_train. - Vytvoř trénovací sadu tak, že z
studentnetworkdatavybereš řádky uložené vindex_train, a pojmenuj jitraining_set. - Vytvoř testovací sadu tak, že z
studentnetworkdatavyloučíš řádky uložené vindex_train, a pojmenuj jitest_set.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Set the seed
set.seed(___)
# Creat the index vector
index_train <- sample(1:nrow(___), 2 / 3 * nrow(___))
# Make the training set
training_set <- ___[index_train,]
# Make the test set
___ <- ___[-index_train,]