Créer des ensembles de test aléatoires
Avant de bâtir un modèle de prêt plus sophistiqué, il est important de mettre de côté une partie des données de prêts pour simuler la performance de prédiction auprès de futurs demandeurs.
Comme l'illustre l'image suivante, vous pouvez utiliser 75 % des observations pour l'entraînement et 25 % pour le test du modèle.

La fonction sample() permet de générer un échantillon aléatoire de lignes à inclure dans l'ensemble d'entraînement. Il suffit de lui fournir le nombre total d'observations et le nombre requis pour l'entraînement.
Utilisez le vecteur résultant d'identifiants de lignes pour découper loans en ensembles d'entraînement et de test. Le jeu de données loans est à votre disposition.
Cette activité fait partie du cours
Apprentissage supervisé en R : Classification
Instructions de l’exercice
- Appliquez la fonction
nrow()pour déterminer combien d'observations contient le jeu de donnéesloans, ainsi que le nombre requis pour un échantillon de 75 %. - Utilisez la fonction
sample()pour créer un vecteur d'entiers contenant les identifiants de lignes pour l'échantillon de 75 %. Le premier argument desample()doit être le nombre de lignes du jeu de données, et le second, le nombre de lignes nécessaires pour votre ensemble d'entraînement. - Sous-échantillonnez les données
loansà l'aide des identifiants de lignes pour créer l'ensemble d'entraînement. Enregistrez-le sousloans_train. - Sous-échantillonnez à nouveau
loans, mais cette fois sélectionnez toutes les lignes qui ne sont pas danssample_rows. Enregistrez-le sousloans_test.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Determine the number of rows for training
# Create a random sample of row IDs
sample_rows <- sample(___, ___)
# Create the training dataset
loans_train <- loans[___]
# Create the test dataset
loans_test <- loans[___]