Empiriska regeln
Många statistiska mått som används i dataanalys – inklusive både stickprovsmedelvärdet och stickprovsproportionen – har användbara egenskaper som hjälper oss att förstå populationsparametern av intresse.
En sådan egenskap är att om variabiliteten hos stickprovsproportionen (kallad standardfelet, eller \(SE\)) är känd, kommer ungefär 95 % av alla \(\hat{p}\)-värden (från olika stickprov) att ligga inom \(2SE\) från den sanna populationsproportionen.
För att kontrollera om detta stämmer i det aktuella fallet går vi tillbaka till de opinionsundersökningar som genererats genom att ta många stickprov från samma population.
Datamängden all_polls innehåller 1 000 stickprov med storleken 30, från en population där sannolikheten att rösta på Kandidat X är 0,6.
Observera att du kommer att använda R-funktionen sd(), som beräknar variabiliteten för en uppsättning tal. I statistiken kallas sd() för standardavvikelse när den tillämpas på en variabel (t.ex. huspriser), och standardfel när den tillämpas på en statistika (t.ex. en uppsättning stickpropportioner).
Den här övningen är en del av kursen
Grundläggande inferens i R
Övningsinstruktioner
- Kör koden för att generera
props, dvs. andelen individer som planerar att rösta ja i varje opinionsundersökning. Detta baseras påex1_propsfrån tidigare övningar. - Lägg till en kolumn,
is_in_conf_int, som ärTRUEnär den skattade andelen ja-röster ligger inom2standardfel från den sanna populationsproportionen av ja-röster. Det vill säga att detabs()oluta värdet av skillnaden mellanprop_yesochtrue_prop_yesär mindre än dubblasd()förprop_yes. - Beräkna andelen stickprovsstatistikor som ligger inom konfidensintervallet,
prop_in_conf_int, genom att tamean()avis_in_conf_int.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Proportion of yes votes by poll
props <- all_polls %>%
group_by(poll) %>%
summarize(prop_yes = mean(vote == "yes"))
# The true population proportion of yes votes
true_prop_yes <- 0.6
# Proportion of polls within 2SE
props %>%
# Add column: is prop_yes in 2SE of 0.6
mutate(is_in_conf_int = ___(___ - ___) < ___ * ___(___)) %>%
# Calculate proportion in conf int
summarize(prop_in_conf_int = ___(___))