Khoảng tin cậy t bằng bootstrap
Các bài tập trước cho bạn hai điều:
- Bạn có thể đo lường độ biến thiên gắn với \(\hat{p}\) bằng cách lấy mẫu lại từ mẫu gốc.
- Khi đã biết độ biến thiên của \(\hat{p}\), bạn có thể dùng nó để đo xem tham số thật cách xa bao nhiêu.
Lưu ý rằng tỷ lệ gần đúng (ở đây là 95%) nói về việc một mẫu được chọn thường xuyên đến mức nào để nó gần với tham số quần thể. Bạn sẽ không bao giờ biết một bộ dữ liệu cụ thể là gần hay xa tham số, nhưng bạn biết rằng trong suốt quá trình thu thập dữ liệu, 95% số mẫu bạn thu thập sẽ cho ước lượng nằm trong phạm vi \(2SE\) quanh tham số quần thể thật.
Dữ liệu phiếu bầu từ một cuộc thăm dò, one_poll, và dữ liệu từ 1000 lần lấy mẫu bootstrap, one_poll_boot, đã có sẵn trong không gian làm việc của bạn. Chúng dựa trên Thí nghiệm 2 ở phần trước của chương.
Như ở bài trước, khi bàn về độ biến thiên của một thống kê, con số đó được gọi là sai số chuẩn (standard error).
Bài tập này là một phần của khóa học
Nền tảng Suy luận trong R
Hướng dẫn bài tập
- Tính \(\hat{p}\) và gán kết quả cho
p_hat. Trong lời gọisummarize(), tínhstatlà trung bình củavotebằng"yes". - Tìm một khoảng giá trị hợp lý cho tham số thật bằng cách tính $\hat{p} \pm 2SE`.
- Cận
lowercủa khoảng tin cậy làp_hattrừ hai lần sai số chuẩn củastat. Dùngsd()để tính sai số chuẩn. - Cận
upperlàp_hatcộng hai lần sai số chuẩn củastat.
- Cận
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# From previous exercises
one_poll <- all_polls %>%
filter(poll == 1) %>%
select(vote)
one_poll_boot <- one_poll %>%
specify(response = vote, success = "yes") %>%
generate(reps = 1000, type = "bootstrap") %>%
calculate(stat = "prop")
p_hat <- one_poll %>%
# Calculate proportion of yes votes
summarize(stat = ___) %>%
pull()
# Create an interval of plausible values
one_poll_boot %>%
summarize(
# Lower bound is p_hat minus 2 std errs
lower = ___,
# Upper bound is p_hat plus 2 std errs
upper = ___
)