CommencezCommencez gratuitement

Échantillonnage aléatoire simple

La méthode la plus simple pour échantillonner une population est celle que vous avez déjà vue. Elle s'appelle l'« échantillonnage aléatoire simple » (souvent abrégé « SRS ») et consiste à sélectionner des lignes au hasard, une à la fois, en donnant à chaque ligne la même probabilité d'être choisie qu'aux autres.

Pour repérer plus facilement quelles lignes se retrouvent dans l'échantillon, il est utile d'ajouter une colonne d'identifiant de ligne au jeu de données avant de tirer l'échantillon.

Dans ce chapitre, nous allons examiner des méthodes d'échantillonnage à l'aide d'un jeu de données synthétique (fictif) d'attrition des employés d'IBM, où « attrition » signifie quitter l'entreprise.

attrition_pop est disponible; dplyr est chargé.

Cette activité fait partie du cours

Échantillonnage en R

Voir le cours

Instructions de l’exercice

  • Affichez le jeu de données attrition_pop. Explorez-le dans le visualiseur jusqu'à bien comprendre ce qu'il contient.
  • Fixez la graine aléatoire à la valeur de votre choix.
  • Ajoutez une colonne d'identifiant de ligne au jeu de données, puis utilisez l'échantillonnage aléatoire simple pour obtenir 200 lignes.
  • Affichez le jeu de données échantillonné, attrition_samp. Qu'observez-vous au sujet des identifiants de ligne ?

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# View the attrition_pop dataset
___

# Set the seed
___

attrition_samp <- attrition_pop %>% 
  # Add a row ID column
  ___ %>% 
  # Get 200 rows using simple random sampling
  ___

# View the attrition_samp dataset
___
Modifier et exécuter le code