Zacznij terazZacznij za darmo

Przedział ufności t oparty na bootstrapie

Poprzednie ćwiczenia pokazały ci dwie ważne rzeczy:

  1. Zmienność \(\hat{p}\) można zmierzyć, wykonując ponowne próbkowanie z oryginalnej próbki.
  2. Gdy znasz już zmienność \(\hat{p}\), możesz jej użyć do oceny, jak daleko może znajdować się prawdziwa proporcja.

Zwróć uwagę, że poziom ufności (tutaj 95%) oznacza, jak często wybrana próbka jest bliska parametrowi populacji. Nigdy nie będziesz wiedzieć, czy konkretny zbiór danych jest blisko parametru, czy daleko od niego – wiesz jednak, że w długim horyzoncie 95% próbek, które zbierzesz, powinno dawać oszacowania mieszczące się w zakresie \(2SE\) od prawdziwego parametru populacji.

W twoim środowisku dostępne są: wyniki z jednego badania ankietowego, one_poll, oraz dane z 1000 próbkowania bootstrapowego, one_poll_boot. Opierają się one na Eksperymencie 2 z wcześniejszej części rozdziału.

Podobnie jak w poprzednim ćwiczeniu, mówiąc o zmienności statystyki, używamy pojęcia błędu standardowego.

To ćwiczenie jest częścią kursu

Podstawy wnioskowania statystycznego w R

Zobacz kurs

Instrukcje do ćwiczenia

  • Oblicz \(\hat{p}\) i przypisz wynik do p_hat. W wywołaniu summarize() oblicz stat jako średnią wartości vote równych "yes".
  • Wyznacz przedział wartości wiarygodnych dla prawdziwego parametru, obliczając \(\hat{p} \pm 2SE\).
    • Dolna granica (lower) przedziału ufności to p_hat minus dwukrotność błędu standardowego stat. Użyj sd(), aby obliczyć błąd standardowy.
    • Górna granica (upper) to p_hat plus dwukrotność błędu standardowego stat.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# From previous exercises
one_poll <- all_polls %>%
  filter(poll == 1) %>%
  select(vote)
one_poll_boot <- one_poll %>%
  specify(response = vote, success = "yes") %>%
  generate(reps = 1000, type = "bootstrap") %>% 
  calculate(stat = "prop")
  
p_hat <- one_poll %>%
  # Calculate proportion of yes votes
  summarize(stat = ___) %>%
  pull()

# Create an interval of plausible values
one_poll_boot %>%
  summarize(
    # Lower bound is p_hat minus 2 std errs
    lower = ___,
    # Upper bound is p_hat plus 2 std errs
    upper = ___
  )
Edytuj i uruchom kod