CommencerCommencez gratuitement

Scinder le jeu de données

Pour créer vos ensembles d’entraînement et de test, vous devez d’abord fixer une graine avec set.seed(). Une graine définit un point de départ pour la génération aléatoire, afin que le même résultat soit obtenu à chaque exécution du code. L’avantage, c’est que vous ou toute autre personne pouvez recréer exactement les mêmes ensembles d’entraînement et de test en utilisant la même graine.

Avec sample(), vous pouvez répartir aléatoirement les observations entre l’ensemble d’entraînement et l’ensemble de test.

Dans cet exercice, vous utiliserez les deux premiers arguments de la fonction sample() :

  • Le premier argument est le vecteur dans lequel on échantillonne des valeurs. Nous allons sélectionner aléatoirement des numéros de lignes comme indices ; vous pouvez utiliser 1:nrow(loan_data) pour créer le vecteur des numéros de lignes.
  • Le second argument est le nombre d’éléments à sélectionner. Nous utiliserons 2 / 3 * nrow(loan_data), puisque nous construisons d’abord l’ensemble d’entraînement.

Cet exercice fait partie du cours

<cours>Modélisation du risque de crédit en R</cours>
Voir le cours

Instructions de l’exercice

  • Fixez la graine à 567 à l’aide de la fonction set.seed().
  • Stockez les indices de lignes de l’ensemble d’entraînement dans l’objet index_train. Utilisez la fonction sample() avec un premier et un second argument comme expliqué ci-dessus.
  • Créez l’ensemble d’entraînement en sélectionnant, dans le jeu de données loan_data, les numéros de lignes stockés dans index_train. Enregistrez le résultat dans training_set.
  • L’ensemble de test contient les lignes qui ne sont pas dans index_train. Copiez le code utilisé pour créer l’ensemble d’entraînement, mais utilisez le signe négatif (-) juste avant index_train à l’intérieur des crochets. Enregistrez le résultat dans test_set.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Set seed of 567


# Store row numbers for training set: index_train


# Create training set: training_set
training_set <- loan_data[___, ]

# Create test set: test_set
Modifier et exécuter le code