НачатьНачать бесплатно

Разбивка на обучающую и тестовую выборки

Теперь, когда у нас есть датафрейм, можно применять стандартные методы моделирования. В этом упражнении вы разобьёте данные на обучающую и тестовую выборки.

Это упражнение является частью курса

Прогнозная аналитика на основе сетевых данных в R

Посмотреть курс

Инструкции к упражнению

  • Чтобы обеспечить воспроизводимость результатов, установите начальное значение генератора случайных чисел равным 7 с помощью set.seed().
  • Используйте функцию sample(), чтобы случайным образом выбрать две трети чисел из диапазона, соответствующего общему числу строк в studentnetworkdata. Назовите этот вектор index_train.
  • Создайте обучающую выборку, включив строки studentnetworkdata с индексами из index_train, и присвойте ей имя training_set.
  • Создайте тестовую выборку, исключив строки studentnetworkdata с индексами из index_train, и присвойте ей имя test_set.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Set the seed
set.seed(___)

# Creat the index vector
index_train <- sample(1:nrow(___), 2 / 3 * nrow(___))

# Make the training set
training_set <- ___[index_train,]

# Make the test set
___ <- ___[-index_train,]
Редактировать и запускать код