Prosté náhodné vzorkování
Nejjednodušší metodou vzorkování populace je ta, kterou už znáš. Říká se jí prosté náhodné vzorkování (anglicky "simple random sampling", zkráceně "SRS") a spočívá v náhodném výběru řádků jeden po druhém, přičemž každý řádek má stejnou šanci být vybrán jako kterýkoli jiný.
Aby bylo dobře vidět, které řádky se do vzorku dostaly, je užitečné před samotným vzorkováním přidat do datasetu sloupec s ID řádků.
V této kapitole se podíváme na metody vzorkování pomocí syntetického (fiktivního) datasetu od IBM o odchodu zaměstnanců, kde „attrition" znamená odchod ze společnosti.
K dispozici máš attrition_pop; dplyr je načtený.
Toto cvičení je součástí kurzu
Vzorkování v R
Pokyny k cvičení
- Zobraz dataset
attrition_pop. Prozkoumej ho v prohlížeči, dokud si nebudeš jistý/á, co obsahuje. - Nastav náhodné semínko na hodnotu podle vlastního výběru.
- Přidej do datasetu sloupec s ID řádků a pak pomocí prostého náhodného vzorkování vyber 200 řádků.
- Zobraz vzorový dataset
attrition_samp. Čeho si všímáš u ID řádků?
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# View the attrition_pop dataset
___
# Set the seed
___
attrition_samp <- attrition_pop %>%
# Add a row ID column
___ %>%
# Get 200 rows using simple random sampling
___
# View the attrition_samp dataset
___