Поділ на train і test
Тепер, коли у нас є датафрейм, можна застосувати стандартні методи моделювання. У цій вправі ви поділите дані на тренувальну та тестову вибірки.
Ця вправа є частиною курсу
Прогнозна аналітика з мережевими даними в R
Інструкції до вправи
- Щоб забезпечити відтворюваність результатів, установіть зерно випадковості 7 за допомогою
set.seed(). - Скористайтеся функцією
sample(), щоб вибрати дві третини чисел із послідовності в діапазоні загальної кількості рядків уstudentnetworkdata. Назвіть цей векторindex_train. - Створіть тренувальну вибірку, включивши рядки
studentnetworkdata, індекси яких збережені вindex_train, і назвіть їїtraining_set. - Створіть тестову вибірку, виключивши рядки
studentnetworkdata, індекси яких збережені вindex_train, і назвіть їїtest_set.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Set the seed
set.seed(___)
# Creat the index vector
index_train <- sample(1:nrow(___), 2 / 3 * nrow(___))
# Make the training set
training_set <- ___[index_train,]
# Make the test set
___ <- ___[-index_train,]