CommencezCommencez gratuitement

Créer des ensembles de test aléatoires

Avant de bâtir un modèle de prêt plus sophistiqué, il est important de mettre de côté une partie des données de prêts pour simuler la performance de prédiction auprès de futurs demandeurs.

Comme l'illustre l'image suivante, vous pouvez utiliser 75 % des observations pour l'entraînement et 25 % pour le test du modèle.

La fonction sample() permet de générer un échantillon aléatoire de lignes à inclure dans l'ensemble d'entraînement. Il suffit de lui fournir le nombre total d'observations et le nombre requis pour l'entraînement.

Utilisez le vecteur résultant d'identifiants de lignes pour découper loans en ensembles d'entraînement et de test. Le jeu de données loans est à votre disposition.

Cette activité fait partie du cours

Apprentissage supervisé en R : Classification

Voir le cours

Instructions de l’exercice

  • Appliquez la fonction nrow() pour déterminer combien d'observations contient le jeu de données loans, ainsi que le nombre requis pour un échantillon de 75 %.
  • Utilisez la fonction sample() pour créer un vecteur d'entiers contenant les identifiants de lignes pour l'échantillon de 75 %. Le premier argument de sample() doit être le nombre de lignes du jeu de données, et le second, le nombre de lignes nécessaires pour votre ensemble d'entraînement.
  • Sous-échantillonnez les données loans à l'aide des identifiants de lignes pour créer l'ensemble d'entraînement. Enregistrez-le sous loans_train.
  • Sous-échantillonnez à nouveau loans, mais cette fois sélectionnez toutes les lignes qui ne sont pas dans sample_rows. Enregistrez-le sous loans_test.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Determine the number of rows for training


# Create a random sample of row IDs
sample_rows <- sample(___, ___)

# Create the training dataset
loans_train <- loans[___]

# Create the test dataset
loans_test <- loans[___]
Modifier et exécuter le code