Reeșantionarea datelor NHANES
Datele NHANES sunt colectate de la unități eșantionate (persoane) selectate special pentru a reprezenta populația SUA. Hai să reeșantionăm setul de date nhanes_final în moduri diferite, ca să înțelegem mai bine metodele de eșantionare disponibile.
Poți realiza un eșantion aleatoriu simplu folosind slice_sample() din dplyr. Funcția primește ca intrare un set de date și un număr întreg reprezentând câte rânduri să fie eșantionate.
Eșantionarea stratificată se realizează combinând group_by() și slice_sample(). Funcția va eșantiona n observații din fiecare grup specificat în group_by().
Funcția cluster() din pachetul sampling creează eșantioane de tip cluster. Primește ca argumente numele setului de date, variabila din set utilizată ca variabilă de cluster (transmisă ca vector cu numele sub formă de șir de caractere, de exemplu c("variabila")), numărul de clustere de selectat și o metodă.
Acest exercițiu face parte din cursul
Design Experimental în R
Instrucțiuni pentru exercițiu
- Folosește
slice_sample()pentru a selecta 2500 de observații dinnhanes_finalși salvează rezultatul canhanes_srs. - Creează
nhanes_stratifiedfolosindgroup_by()șislice_sample(). Stratifică dupăriagendrși selectează câte 2000 de observații pentru fiecare gen. Verifică dacă a funcționat corect folosindcount()pentru a examina variabila de gen dinnhanes_stratified. - Încarcă pachetul
sampling. Foloseștecluster()pentru a împărținhanes_finaldupă"indhhin2"în 6 clustere, utilizând metoda"srswor". Atribuie rezultatul variabileinhanes_cluster.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Use slice_sample() to create nhanes_srs
nhanes_srs <- ___ %>% ___(n=___)
# Create nhanes_stratified with group_by() and slice_sample()
___ <- ___ %>% group_by(___) %>% ___(n=___)
nhanes_stratified %>% ___
# Load sampling package and create nhanes_cluster with cluster()
___
nhanes_cluster <- cluster(___, "___", 6, method = "srswor")