Empirické pravidlo
Mnoho statistik, které v analýze dat používáme (včetně výběrového průměru i výběrového podílu), má užitečné vlastnosti, díky nimž lze lépe pochopit parametr(y) základního souboru.
Jednou z těchto vlastností je, že pokud je známa variabilita výběrového podílu (označovaná jako standardní chyba, neboli \(SE\)), pak přibližně 95 % hodnot \(\hat{p}\) (z různých výběrů) leží v rozmezí \(2SE\) od skutečného podílu v základním souboru.
Aby ses přesvědčil/a, zda to platí i v tomto případě, vraťme se k průzkumům vygenerovaným z mnoha výběrů ze stejného základního souboru.
Dataset all_polls obsahuje 1 000 výběrů o velikosti 30 ze základního souboru, kde pravděpodobnost hlasování pro kandidáta X je 0,6.
Budeš používat funkci sd() z R, která vypočítá variabilitu libovolné sady čísel. Ve statistice, když aplikujeme sd() na proměnnou (např. ceny nemovitostí), mluvíme o směrodatné odchylce. Když ji aplikujeme na statistiku (např. sadu výběrových podílů), mluvíme o standardní chybě.
Toto cvičení je součástí kurzu
Základy statistické inference v R
Pokyny k cvičení
- Spusť kód pro výpočet
props– podílu respondentů, kteří plánují hlasovat „ano" v každém průzkumu. Vychází zex1_propsz předchozích cvičení. - Přidej sloupec
is_in_conf_int, který bude mít hodnotuTRUE, pokud je výběrový podíl hlasů „ano" méně než2standardní chyby vzdálený od skutečného podílu „ano" v základním souboru. Jinými slovy,abs()olutní rozdíl meziprop_yesatrue_prop_yesmusí být menší než dvojnásobeksd()hodnotyprop_yes. - Vypočítej podíl výběrových statistik ležících v intervalu spolehlivosti,
prop_in_conf_int, pomocí funkcemean()aplikované nais_in_conf_int.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Proportion of yes votes by poll
props <- all_polls %>%
group_by(poll) %>%
summarize(prop_yes = mean(vote == "yes"))
# The true population proportion of yes votes
true_prop_yes <- 0.6
# Proportion of polls within 2SE
props %>%
# Add column: is prop_yes in 2SE of 0.6
mutate(is_in_conf_int = ___(___ - ___) < ___ * ___(___)) %>%
# Calculate proportion in conf int
summarize(prop_in_conf_int = ___(___))