Začněte nyníZačněte zdarma

Opětovné vzorkování dat NHANES

Data NHANES jsou sbírána na vzorkovaných jedincích záměrně vybraných tak, aby reprezentovali populaci USA. Pojďme si ale dataset nhanes_final převzorkovat různými způsoby a lépe tak pochopit jednotlivé metody vzorkování.

Prostý náhodný výběr provedeme pomocí slice_sample() z balíčku dplyr. Funkce přijímá dataset a celé číslo určující počet řádků k výběru.

Stratifikovaný výběr lze provést kombinací group_by() a slice_sample(). Funkce vybere n záznamů z každé skupiny definované v group_by().

Funkce cluster() z balíčku sampling vytváří clusterové výběry. Přijímá název datasetu, proměnnou, která slouží jako clusterová proměnná (předanou jako vektor s názvem ve formě řetězce, např. c("variable")), počet clusterů k výběru a metodu.

Toto cvičení je součástí kurzu

Experimental Design in R

Zobrazit kurz

Pokyny k cvičení

  • Pomocí slice_sample() vyber 2 500 pozorování z nhanes_final a ulož je jako nhanes_srs.
  • Vytvoř nhanes_stratified pomocí group_by() a slice_sample(). Stratifikuj podle proměnné riagendr a vyber 2 000 záznamů za každé pohlaví. Ověř výsledek pomocí count() na proměnné pohlaví v nhanes_stratified.
  • Načti balíček sampling. Pomocí cluster() rozděl nhanes_final podle "indhhin2" do 6 clusterů metodou "srswor". Výsledek ulož do nhanes_cluster.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Use slice_sample() to create nhanes_srs
nhanes_srs <- ___ %>% ___(n=___)

# Create nhanes_stratified with group_by() and slice_sample()
___ <- ___ %>% group_by(___) %>% ___(n=___)
nhanes_stratified %>% ___

# Load sampling package and create nhanes_cluster with cluster()
___
nhanes_cluster <- cluster(___, "___", 6, method = "srswor")
Upravit a spustit kód