CommencezCommencez gratuitement

Essayez une répartition 80/20

Maintenant que votre jeu de données est ordonné aléatoirement, vous pouvez en séparer les 80 % premiers pour former un ensemble d'entraînement, et les 20 % restants pour former un ensemble de test. Vous pouvez procéder en choisissant un point de coupure correspondant à environ 80 % de vos données :

split <- round(nrow(mydata) * 0.80)

Vous pouvez ensuite utiliser ce point pour extraire les 80 % premiers du jeu de données comme ensemble d'entraînement :

mydata[1:split, ]

Puis utiliser ce même point pour déterminer l'ensemble de test :

mydata[(split + 1):nrow(mydata), ]

Cette activité fait partie du cours

Machine Learning avec caret en R

Voir le cours

Instructions de l’exercice

  • Choisissez un indice de ligne pour effectuer la séparation de sorte que le point de coupure se trouve à environ 80 % du jeu de données diamonds. Nommez cet indice split.
  • Créez un ensemble d'entraînement nommé train à partir de cet indice.
  • Créez un ensemble de test nommé test à partir de cet indice.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Determine row to split on: split


# Create train


# Create test
Modifier et exécuter le code