Rééchantillonnage des données NHANES
Les données NHANES sont recueillies auprès d'unités échantillonnées (des personnes) spécialement sélectionnées pour représenter la population américaine. Toutefois, rééchantillonnons l'ensemble nhanes_final de différentes façons pour nous familiariser avec diverses méthodes d'échantillonnage.
On peut réaliser un échantillon aléatoire simple avec slice_sample() de dplyr. Cette fonction prend en entrée un jeu de données et un entier indiquant le nombre de lignes à échantillonner.
L'échantillonnage stratifié peut se faire en combinant group_by() et slice_sample(). La fonction prélève n observations dans chacun des groupes définis par group_by().
La fonction cluster() du paquet sampling crée des échantillons en grappes. Elle prend le nom d'un jeu de données, la variable à utiliser comme variable de grappe, fournie sous forme de vecteur contenant le nom comme chaîne de caractères (p. ex. c("variable")), un nombre de grappes à sélectionner et une méthode.
Cette activité fait partie du cours
Plan d'expériences avec R
Instructions de l’exercice
- Utilisez
slice_sample()pour sélectionner 2500 observations à partir denhanes_finalet enregistrez le résultat dansnhanes_srs. - Créez
nhanes_stratifieden utilisantgroup_by()etslice_sample(). Stratifiez parriagendret sélectionnez 2000 observations pour chaque genre. Vérifiez que cela a fonctionné en utilisantcount()pour examiner la variable de genre denhanes_stratified. - Chargez le paquet
sampling. Utilisezcluster()pour partitionnernhanes_finalselon"indhhin2"en 6 grappes avec la méthode"srswor". Assignez le résultat ànhanes_cluster.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Use slice_sample() to create nhanes_srs
nhanes_srs <- ___ %>% ___(n=___)
# Create nhanes_stratified with group_by() and slice_sample()
___ <- ___ %>% group_by(___) %>% ___(n=___)
nhanes_stratified %>% ___
# Load sampling package and create nhanes_cluster with cluster()
___
nhanes_cluster <- cluster(___, "___", 6, method = "srswor")