Разбивка на обучающую и тестовую выборки
Теперь, когда у нас есть датафрейм, можно применять стандартные методы моделирования. В этом упражнении вы разобьёте данные на обучающую и тестовую выборки.
Это упражнение является частью курса
Прогнозная аналитика на основе сетевых данных в R
Инструкции к упражнению
- Чтобы обеспечить воспроизводимость результатов, установите начальное значение генератора случайных чисел равным 7 с помощью
set.seed(). - Используйте функцию
sample(), чтобы случайным образом выбрать две трети чисел из диапазона, соответствующего общему числу строк вstudentnetworkdata. Назовите этот векторindex_train. - Создайте обучающую выборку, включив строки
studentnetworkdataс индексами изindex_train, и присвойте ей имяtraining_set. - Создайте тестовую выборку, исключив строки
studentnetworkdataс индексами изindex_train, и присвойте ей имяtest_set.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Set the seed
set.seed(___)
# Creat the index vector
index_train <- sample(1:nrow(___), 2 / 3 * nrow(___))
# Make the training set
training_set <- ___[index_train,]
# Make the test set
___ <- ___[-index_train,]