Začněte nyníZačněte zdarma

Převzorkování ze vzorku

Abys zjistil/a, jak moc se odhady proporce populace liší od vzorku k vzorku, nastavíš dva vzorkovací experimenty.

V prvním experimentu budeš simulovat opakované vzorky z populace. Ve druhém vybereme jediný vzorek z prvního experimentu a budeme z něj opakovaně převzorkovávat – tato metoda se nazývá bootstrapping. Konkrétně:

Experiment 1: Předpokládej, že skutečný podíl lidí, kteří budou hlasovat pro kandidáta X, je 0,6. Opakovaně vybereme 30 lidí z populace a změříme variabilitu \(\hat{p}\) (proporce vzorku).

Experiment 2: Vezmi jeden vzorek velikosti 30 ze stejné populace. Opakovaně vyber 30 lidí (s nahrazením!) z původního vzorku a změř variabilitu \(\hat{p}^*\) (proporce převzorku).

Je důležité si uvědomit, že první experiment předpokládá znalost populace, což je v praxi obvykle nemožné. Druhý vychází pouze ze vzorku dat, a proto ho lze snadno použít pro jakoukoli statistiku. Jak uvidíš, variabilita \(\hat{p}\), tedy podílu „úspěchů" ve vzorku, je přibližně stejná – ať vzorkujeme z populace, nebo převzorkovávame ze vzorku.

Připravili jsme 1 000 náhodných vzorků, každý o velikosti 30, z populace. Výsledný datový rámec all_polls je dostupný v tvém pracovním prostředí. Prohlédni si ho, než začneš.

Toto cvičení je součástí kurzu

Základy statistické inference v R

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Compute p-hat for each poll
ex1_props <- all_polls %>% 
  # Group by poll
  ___(___) %>% 
  # Calculate proportion of yes votes
  ___(stat = ___(___))
  
# Review the result
ex1_props
Upravit a spustit kód