CommencezCommencez gratuitement

Essayez une répartition 60/40

Comme vous l'avez vu dans la vidéo, vous allez travailler avec l'ensemble de données Sonar dans ce chapitre, en utilisant un ensemble d'entraînement de 60 % et un ensemble de test de 40 %. Nous allons refaire une fois la création d'une répartition entraînement/test pour nous assurer que vous maîtrisez bien la démarche. Rappelez-vous que vous pouvez utiliser la fonction sample() pour obtenir une permutation aléatoire des indices de lignes d'un ensemble de données, à utiliser pour créer des répartitions entraînement/test, par exemple :

n_obs <- nrow(my_data)
permuted_rows <- sample(n_obs)

Puis utiliser ces indices de lignes pour réordonner l'ensemble de données de façon aléatoire, par exemple :

my_data <- my_data[permuted_rows, ]

Une fois votre ensemble de données réordonné aléatoirement, vous pouvez séparer les 60 % premières lignes comme ensemble d'entraînement et les 40 % dernières comme ensemble de test.

Cette activité fait partie du cours

Machine Learning avec caret en R

Voir le cours

Instructions de l’exercice

  • Obtenez le nombre d'observations (lignes) dans Sonar et assignez-le à n_obs.
  • Mélangez les indices de lignes de Sonar et enregistrez le résultat dans permuted_rows.
  • Utilisez permuted_rows pour réordonner aléatoirement les lignes de Sonar, et sauvegardez le tout dans Sonar_shuffled.
  • Déterminez la ligne appropriée pour effectuer une répartition 60/40. Enregistrez ce numéro de ligne dans split.
  • Sauvegardez les 60 % premières lignes de Sonar_shuffled comme ensemble d'entraînement.
  • Sauvegardez les 40 % dernières lignes de Sonar_shuffled comme ensemble de test.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Get the number of observations


# Shuffle row indices: permuted_rows


# Randomly order data: Sonar


# Identify row to split on: split
split <- round(n_obs * ___)

# Create train


# Create test
Modifier et exécuter le code