CommencezCommencez gratuitement

Scinder l'ensemble de données

Pour créer vos ensembles d'entraînement et de test, commencez par fixer une graine avec set.seed(). Une graine permet de définir un point de départ pour la génération aléatoire de nombres, de sorte que chaque exécution du code produise le même résultat. L'avantage, dans le cadre de votre échantillonnage, est que vous ou toute autre personne pourrez recréer exactement les mêmes ensembles d'entraînement et de test en utilisant la même graine.

Avec sample(), vous pouvez attribuer aléatoirement des observations aux ensembles d'entraînement et de test.

Dans cet exercice, vous utiliserez les deux premiers arguments de la fonction sample() :

  • Le premier argument est le vecteur dans lequel on prélève des valeurs. Nous choisirons au hasard des numéros de lignes comme indices; vous pouvez utiliser 1:nrow(loan_data) pour créer le vecteur des numéros de lignes.
  • Le deuxième argument est le nombre d'éléments à choisir. Nous saisirons 2 / 3 * nrow(loan_data), puisque nous construisons d'abord l'ensemble d'entraînement.

Cette activité fait partie du cours

Modélisation du risque de crédit en R

Voir le cours

Instructions de l’exercice

  • Fixez la graine à 567 avec la fonction set.seed().
  • Stockez les indices de lignes de l'ensemble d'entraînement dans l'objet index_train. Utilisez la fonction sample() avec un premier et un deuxième argument tels que décrits ci-dessus.
  • Créez l'ensemble d'entraînement en sélectionnant, dans l'ensemble de données loan_data, les numéros de lignes stockés dans index_train. Enregistrez le résultat dans training_set.
  • L'ensemble de test contient les lignes qui ne sont pas dans index_train. Copiez le code utilisé pour créer l'ensemble d'entraînement, mais ajoutez le signe négatif (-) juste avant index_train à l'intérieur des crochets. Enregistrez le résultat dans test_set.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Set seed of 567


# Store row numbers for training set: index_train


# Create training set: training_set
training_set <- loan_data[___, ]

# Create test set: test_set
Modifier et exécuter le code