Échantillonnage aléatoire simple
La méthode la plus simple pour échantillonner une population est celle que vous avez déjà vue. Elle s'appelle l'« échantillonnage aléatoire simple » (souvent abrégé « SRS ») et consiste à sélectionner des lignes au hasard, une à la fois, en donnant à chaque ligne la même probabilité d'être choisie qu'aux autres.
Pour repérer plus facilement quelles lignes se retrouvent dans l'échantillon, il est utile d'ajouter une colonne d'identifiant de ligne au jeu de données avant de tirer l'échantillon.
Dans ce chapitre, nous allons examiner des méthodes d'échantillonnage à l'aide d'un jeu de données synthétique (fictif) d'attrition des employés d'IBM, où « attrition » signifie quitter l'entreprise.
attrition_pop est disponible; dplyr est chargé.
Cette activité fait partie du cours
Échantillonnage en R
Instructions de l’exercice
- Affichez le jeu de données
attrition_pop. Explorez-le dans le visualiseur jusqu'à bien comprendre ce qu'il contient. - Fixez la graine aléatoire à la valeur de votre choix.
- Ajoutez une colonne d'identifiant de ligne au jeu de données, puis utilisez l'échantillonnage aléatoire simple pour obtenir 200 lignes.
- Affichez le jeu de données échantillonné,
attrition_samp. Qu'observez-vous au sujet des identifiants de ligne ?
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# View the attrition_pop dataset
___
# Set the seed
___
attrition_samp <- attrition_pop %>%
# Add a row ID column
___ %>%
# Get 200 rows using simple random sampling
___
# View the attrition_samp dataset
___