Intervalul de încredere bootstrap de tip t
Exercițiile anterioare ți-au arătat două lucruri:
- Poți măsura variabilitatea asociată cu \(\hat{p}\) prin reeșantionare din eșantionul original.
- Odată ce cunoști variabilitatea lui \(\hat{p}\), o poți folosi pentru a estima cât de departe se află proporția adevărată.
Reține că rata de apropiere (în acest caz, 95%) se referă la cât de des un eșantion este ales astfel încât să fie aproape de parametrul populației. Nu vei ști niciodată dacă un anumit set de date este aproape sau departe de parametru, dar știi că, pe parcursul activității tale, 95% din eșantioanele pe care le colectezi ar trebui să îți ofere estimări aflate în intervalul \(2SE\) față de parametrul adevărat al populației.
Voturile dintr-un singur sondaj, one_poll, și datele din 1000 de reeșantionări bootstrap, one_poll_boot, sunt disponibile în spațiul tău de lucru. Acestea se bazează pe Experimentul 2 de mai devreme din capitol.
Ca și în exercițiul anterior, când discutăm despre variabilitatea unei statistici, valoarea respectivă se numește eroare standard.
Acest exercițiu face parte din cursul
Bazele inferenței în R
Instrucțiuni pentru exercițiu
- Calculează \(\hat{p}\) și atribuie rezultatul variabilei
p_hat. În apelul lasummarize(), calculeazăstatca media valorilor dinvoteegale cu"yes". - Găsește un interval de valori plauzibile pentru parametrul adevărat calculând \(\hat{p} \pm 2SE\).
- Limita
lowera intervalului de încredere estep_hatminus de două ori eroarea standard a luistat. Foloseștesd()pentru a calcula eroarea standard. - Limita
upperestep_hatplus de două ori eroarea standard a luistat.
- Limita
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# From previous exercises
one_poll <- all_polls %>%
filter(poll == 1) %>%
select(vote)
one_poll_boot <- one_poll %>%
specify(response = vote, success = "yes") %>%
generate(reps = 1000, type = "bootstrap") %>%
calculate(stat = "prop")
p_hat <- one_poll %>%
# Calculate proportion of yes votes
summarize(stat = ___) %>%
pull()
# Create an interval of plausible values
one_poll_boot %>%
summarize(
# Lower bound is p_hat minus 2 std errs
lower = ___,
# Upper bound is p_hat plus 2 std errs
upper = ___
)