Bắt đầu ngayBắt đầu miễn phí

Xây dựng khoảng tin cậy (CI)

Bạn đã thấy một ví dụ về cách p-hat thay đổi khi lấy mẫu lại, nhưng chúng ta cần làm việc này thật nhiều lần để ước lượng tốt mức độ biến thiên của nó. Ở đây bạn sẽ tính toàn bộ phân phối bootstrap để ước lượng sai số chuẩn (SE) dùng để lập khoảng tin cậy. Bạn sẽ dùng thêm một động từ trong infer, calculate(), để tối ưu quy trình tính nhiều thống kê từ nhiều bộ dữ liệu.

Hãy dành chút thời gian xem đầu ra của calculate. Hàm này rút gọn data frame của bạn chỉ còn hai cột: một cột cho các "stat" và một cột cho "replicate" tương ứng.

Khi vẽ phân phối bootstrap, bạn sẽ thấy nó có dạng chuông. Chính hình dạng này cho phép bạn cộng và trừ hai lần SE để được khoảng 95%.

Bài tập này là một phần của khóa học

Suy luận cho dữ liệu phân loại trong R

Xem khóa học

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Create bootstrap distribution for proportion with High conf
boot_dist <- gss2016 %>%
  # Specify the response and success
  specify(response = ___, ___ = "___") %>%
  # Generate 500 bootstrap reps
  generate(___ = ___, type = "bootstrap") %>%
  # Calculate proportions
  calculate(stat = "___")

# See the result
boot_dist
Chỉnh sửa và Chạy Mã