Essayez une répartition 60/40
Comme vous l'avez vu dans la vidéo, vous allez travailler avec l'ensemble de données Sonar dans ce chapitre, en utilisant un ensemble d'entraînement de 60 % et un ensemble de test de 40 %. Nous allons refaire une fois la création d'une répartition entraînement/test pour nous assurer que vous maîtrisez bien la démarche. Rappelez-vous que vous pouvez utiliser la fonction sample() pour obtenir une permutation aléatoire des indices de lignes d'un ensemble de données, à utiliser pour créer des répartitions entraînement/test, par exemple :
n_obs <- nrow(my_data)
permuted_rows <- sample(n_obs)
Puis utiliser ces indices de lignes pour réordonner l'ensemble de données de façon aléatoire, par exemple :
my_data <- my_data[permuted_rows, ]
Une fois votre ensemble de données réordonné aléatoirement, vous pouvez séparer les 60 % premières lignes comme ensemble d'entraînement et les 40 % dernières comme ensemble de test.
Cette activité fait partie du cours
Machine Learning avec caret en R
Instructions de l’exercice
- Obtenez le nombre d'observations (lignes) dans
Sonaret assignez-le àn_obs. - Mélangez les indices de lignes de
Sonaret enregistrez le résultat danspermuted_rows. - Utilisez
permuted_rowspour réordonner aléatoirement les lignes deSonar, et sauvegardez le tout dansSonar_shuffled. - Déterminez la ligne appropriée pour effectuer une répartition 60/40. Enregistrez ce numéro de ligne dans
split. - Sauvegardez les 60 % premières lignes de
Sonar_shuffledcomme ensemble d'entraînement. - Sauvegardez les 40 % dernières lignes de
Sonar_shuffledcomme ensemble de test.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Get the number of observations
# Shuffle row indices: permuted_rows
# Randomly order data: Sonar
# Identify row to split on: split
split <- round(n_obs * ___)
# Create train
# Create test