Opětovné vzorkování dat NHANES
Data NHANES jsou sbírána na vzorkovaných jedincích záměrně vybraných tak, aby reprezentovali populaci USA. Pojďme si ale dataset nhanes_final převzorkovat různými způsoby a lépe tak pochopit jednotlivé metody vzorkování.
Prostý náhodný výběr provedeme pomocí slice_sample() z balíčku dplyr. Funkce přijímá dataset a celé číslo určující počet řádků k výběru.
Stratifikovaný výběr lze provést kombinací group_by() a slice_sample(). Funkce vybere n záznamů z každé skupiny definované v group_by().
Funkce cluster() z balíčku sampling vytváří clusterové výběry. Přijímá název datasetu, proměnnou, která slouží jako clusterová proměnná (předanou jako vektor s názvem ve formě řetězce, např. c("variable")), počet clusterů k výběru a metodu.
Toto cvičení je součástí kurzu
Experimental Design in R
Pokyny k cvičení
- Pomocí
slice_sample()vyber 2 500 pozorování znhanes_finala ulož je jakonhanes_srs. - Vytvoř
nhanes_stratifiedpomocígroup_by()aslice_sample(). Stratifikuj podle proměnnériagendra vyber 2 000 záznamů za každé pohlaví. Ověř výsledek pomocícount()na proměnné pohlaví vnhanes_stratified. - Načti balíček
sampling. Pomocícluster()rozdělnhanes_finalpodle"indhhin2"do 6 clusterů metodou"srswor". Výsledek ulož donhanes_cluster.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Use slice_sample() to create nhanes_srs
nhanes_srs <- ___ %>% ___(n=___)
# Create nhanes_stratified with group_by() and slice_sample()
___ <- ___ %>% group_by(___) %>% ___(n=___)
nhanes_stratified %>% ___
# Load sampling package and create nhanes_cluster with cluster()
___
nhanes_cluster <- cluster(___, "___", 6, method = "srswor")