Převzorkování ze vzorku
Abys zjistil/a, jak moc se odhady proporce populace liší od vzorku k vzorku, nastavíš dva vzorkovací experimenty.
V prvním experimentu budeš simulovat opakované vzorky z populace. Ve druhém vybereme jediný vzorek z prvního experimentu a budeme z něj opakovaně převzorkovávat – tato metoda se nazývá bootstrapping. Konkrétně:
Experiment 1: Předpokládej, že skutečný podíl lidí, kteří budou hlasovat pro kandidáta X, je 0,6. Opakovaně vybereme 30 lidí z populace a změříme variabilitu \(\hat{p}\) (proporce vzorku).
Experiment 2: Vezmi jeden vzorek velikosti 30 ze stejné populace. Opakovaně vyber 30 lidí (s nahrazením!) z původního vzorku a změř variabilitu \(\hat{p}^*\) (proporce převzorku).
Je důležité si uvědomit, že první experiment předpokládá znalost populace, což je v praxi obvykle nemožné. Druhý vychází pouze ze vzorku dat, a proto ho lze snadno použít pro jakoukoli statistiku. Jak uvidíš, variabilita \(\hat{p}\), tedy podílu „úspěchů" ve vzorku, je přibližně stejná – ať vzorkujeme z populace, nebo převzorkovávame ze vzorku.
Připravili jsme 1 000 náhodných vzorků, každý o velikosti 30, z populace. Výsledný datový rámec all_polls je dostupný v tvém pracovním prostředí. Prohlédni si ho, než začneš.
Toto cvičení je součástí kurzu
Základy statistické inference v R
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Compute p-hat for each poll
ex1_props <- all_polls %>%
# Group by poll
___(___) %>%
# Calculate proportion of yes votes
___(stat = ___(___))
# Review the result
ex1_props