Začněte nyníZačněte zdarma

Empirické pravidlo

Mnoho statistik, které v analýze dat používáme (včetně výběrového průměru i výběrového podílu), má užitečné vlastnosti, díky nimž lze lépe pochopit parametr(y) základního souboru.

Jednou z těchto vlastností je, že pokud je známa variabilita výběrového podílu (označovaná jako standardní chyba, neboli \(SE\)), pak přibližně 95 % hodnot \(\hat{p}\) (z různých výběrů) leží v rozmezí \(2SE\) od skutečného podílu v základním souboru.

Aby ses přesvědčil/a, zda to platí i v tomto případě, vraťme se k průzkumům vygenerovaným z mnoha výběrů ze stejného základního souboru.

Dataset all_polls obsahuje 1 000 výběrů o velikosti 30 ze základního souboru, kde pravděpodobnost hlasování pro kandidáta X je 0,6.

Budeš používat funkci sd() z R, která vypočítá variabilitu libovolné sady čísel. Ve statistice, když aplikujeme sd() na proměnnou (např. ceny nemovitostí), mluvíme o směrodatné odchylce. Když ji aplikujeme na statistiku (např. sadu výběrových podílů), mluvíme o standardní chybě.

Toto cvičení je součástí kurzu

Základy statistické inference v R

Zobrazit kurz

Pokyny k cvičení

  • Spusť kód pro výpočet props – podílu respondentů, kteří plánují hlasovat „ano" v každém průzkumu. Vychází z ex1_props z předchozích cvičení.
  • Přidej sloupec is_in_conf_int, který bude mít hodnotu TRUE, pokud je výběrový podíl hlasů „ano" méně než 2 standardní chyby vzdálený od skutečného podílu „ano" v základním souboru. Jinými slovy, abs()olutní rozdíl mezi prop_yes a true_prop_yes musí být menší než dvojnásobek sd() hodnoty prop_yes.
  • Vypočítej podíl výběrových statistik ležících v intervalu spolehlivosti, prop_in_conf_int, pomocí funkce mean() aplikované na is_in_conf_int.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Proportion of yes votes by poll
props <- all_polls %>% 
  group_by(poll) %>% 
  summarize(prop_yes = mean(vote == "yes"))

# The true population proportion of yes votes
true_prop_yes <- 0.6

# Proportion of polls within 2SE
props %>%
  # Add column: is prop_yes in 2SE of 0.6
  mutate(is_in_conf_int = ___(___ - ___) < ___ * ___(___)) %>%
  # Calculate  proportion in conf int
  summarize(prop_in_conf_int = ___(___))
Upravit a spustit kód