Essayez une répartition 80/20
Maintenant que votre jeu de données est ordonné aléatoirement, vous pouvez en séparer les 80 % premiers pour former un ensemble d'entraînement, et les 20 % restants pour former un ensemble de test. Vous pouvez procéder en choisissant un point de coupure correspondant à environ 80 % de vos données :
split <- round(nrow(mydata) * 0.80)
Vous pouvez ensuite utiliser ce point pour extraire les 80 % premiers du jeu de données comme ensemble d'entraînement :
mydata[1:split, ]
Puis utiliser ce même point pour déterminer l'ensemble de test :
mydata[(split + 1):nrow(mydata), ]
Cette activité fait partie du cours
Machine Learning avec caret en R
Instructions de l’exercice
- Choisissez un indice de ligne pour effectuer la séparation de sorte que le point de coupure se trouve à environ 80 % du jeu de données
diamonds. Nommez cet indicesplit. - Créez un ensemble d'entraînement nommé
trainà partir de cet indice. - Créez un ensemble de test nommé
testà partir de cet indice.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Determine row to split on: split
# Create train
# Create test