Začněte nyníZačněte zdarma

Prosté náhodné vzorkování

Nejjednodušší metodou vzorkování populace je ta, kterou už znáš. Říká se jí prosté náhodné vzorkování (anglicky "simple random sampling", zkráceně "SRS") a spočívá v náhodném výběru řádků jeden po druhém, přičemž každý řádek má stejnou šanci být vybrán jako kterýkoli jiný.

Aby bylo dobře vidět, které řádky se do vzorku dostaly, je užitečné před samotným vzorkováním přidat do datasetu sloupec s ID řádků.

V této kapitole se podíváme na metody vzorkování pomocí syntetického (fiktivního) datasetu od IBM o odchodu zaměstnanců, kde „attrition" znamená odchod ze společnosti.

K dispozici máš attrition_pop; dplyr je načtený.

Toto cvičení je součástí kurzu

Vzorkování v R

Zobrazit kurz

Pokyny k cvičení

  • Zobraz dataset attrition_pop. Prozkoumej ho v prohlížeči, dokud si nebudeš jistý/á, co obsahuje.
  • Nastav náhodné semínko na hodnotu podle vlastního výběru.
  • Přidej do datasetu sloupec s ID řádků a pak pomocí prostého náhodného vzorkování vyber 200 řádků.
  • Zobraz vzorový dataset attrition_samp. Čeho si všímáš u ID řádků?

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# View the attrition_pop dataset
___

# Set the seed
___

attrition_samp <- attrition_pop %>% 
  # Add a row ID column
  ___ %>% 
  # Get 200 rows using simple random sampling
  ___

# View the attrition_samp dataset
___
Upravit a spustit kód