Diviser en entraînement et test
Maintenant que nous avons un dataframe, nous pouvons appliquer des techniques standards de modélisation. Dans cet exercice, vous diviserez les données en ensembles d'entraînement et de test.
Cette activité fait partie du cours
Analytique prédictive avec des données en réseau dans R
Instructions de l’exercice
- Pour assurer la reproductibilité de vos résultats, définissez la graine à 7 avec
set.seed(). - Utilisez la fonction
sample()pour échantillonner les deux tiers des nombres de la séquence allant de 1 au nombre total de lignes destudentnetworkdata. Nommez ce vecteurindex_train. - Créez l'ensemble d'entraînement en incluant les lignes de
studentnetworkdatadont les indices se trouvent dansindex_trainet nommez-letraining_set. - Créez l'ensemble de test en excluant les lignes de
studentnetworkdatadont les indices se trouvent dansindex_trainet nommez-letest_set.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Set the seed
set.seed(___)
# Creat the index vector
index_train <- sample(1:nrow(___), 2 / 3 * nrow(___))
# Make the training set
training_set <- ___[index_train,]
# Make the test set
___ <- ___[-index_train,]