Začněte nyníZačněte zdarma

Rozdělení na trénovací a testovací sadu

Teď, když máme dataframe, můžeme použít standardní techniky modelování. V tomto cvičení rozdělíš data na trénovací a testovací sadu.

Toto cvičení je součástí kurzu

Prediktivní analytika pomocí síťových dat v R

Zobrazit kurz

Pokyny k cvičení

  • Aby byly tvoje výsledky reprodukovatelné, nastav seed na hodnotu 7 pomocí set.seed().
  • Pomocí funkce sample() vyber náhodně dvě třetiny čísel z rozsahu celkového počtu řádků v studentnetworkdata. Tento vektor pojmenuj index_train.
  • Vytvoř trénovací sadu tak, že z studentnetworkdata vybereš řádky uložené v index_train, a pojmenuj ji training_set.
  • Vytvoř testovací sadu tak, že z studentnetworkdata vyloučíš řádky uložené v index_train, a pojmenuj ji test_set.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Set the seed
set.seed(___)

# Creat the index vector
index_train <- sample(1:nrow(___), 2 / 3 * nrow(___))

# Make the training set
training_set <- ___[index_train,]

# Make the test set
___ <- ___[-index_train,]
Upravit a spustit kód