CommencezCommencez gratuitement

Générer une répartition aléatoire train/test

Dans les prochains exercices, vous utiliserez les données mpg du paquet ggplot2. Ces données décrivent les caractéristiques de plusieurs marques et modèles de voitures de différentes années. L'objectif est de prédire l'efficacité énergétique en ville à partir de l'efficacité énergétique sur l'autoroute.

Dans cet exercice, vous allez scinder mpg en un ensemble d'entraînement mpg_train (75 % des données) et un ensemble de test mpg_test (25 % des données). Une façon d'y arriver est de générer une colonne de nombres aléatoires uniformes entre 0 et 1 avec la fonction runif() (docs).

Si vous avez un jeu de données dframe de taille \(N\) et que vous voulez un sous-ensemble aléatoire d'environ \(100 * X\) % de \(N\) (où \(X\) est entre 0 et 1), alors :

  1. Générez un vecteur de nombres aléatoires uniformes : gp = runif(N).
  2. dframe[gp < X,] aura à peu près la bonne taille.
  3. dframe[gp >= X,] sera le complément.

Cette activité fait partie du cours

Apprentissage supervisé en R : régression

Voir le cours

Instructions de l’exercice

  • Utilisez la fonction nrow (docs) pour obtenir le nombre de lignes du cadre de données mpg. Attribuez ce total à la variable N et affichez-le.
  • Calculez environ combien de lignes représentent 75 % de N. Attribuez ce nombre à la variable target et affichez-le.
  • Utilisez runif() pour générer un vecteur de N nombres aléatoires uniformes, nommé gp.
  • Servez-vous de gp pour scinder mpg en mpg_train et mpg_test (avec mpg_train contenant environ 75 % des données).
  • Utilisez nrow() pour vérifier la taille de mpg_train et de mpg_test. Sont-ils d'à peu près la bonne taille ?

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# mpg is available
summary(mpg)
dim(mpg)

# Use nrow to get the number of rows in mpg (N) and print it
(N <- ___)

# Calculate how many rows 75% of N should be and print it
# Hint: use round() to get an integer
(target <- ___)

# Create the vector of N uniform random variables: gp
gp <- ___

# Use gp to create the training set: mpg_train (75% of data) and mpg_test (25% of data)
mpg_train <- ___
mpg_test <- ___

# Use nrow() to examine mpg_train and mpg_test
___
___
Modifier et exécuter le code