Bootstrap t-confidence interval
पिछले अभ्यासों ने आपको दो बातें बताईं:
- आप मूल सैंपल से बार-बार resample करके \(\hat{p}\) से जुड़ी variability को measure कर सकते हैं.
- एक बार जब आपको \(\hat{p}\) की variability पता हो जाती है, तो आप इसे इस बात को मापने के तरीके के रूप में इस्तेमाल कर सकते हैं कि true proportion कितनी दूर है.
ध्यान दें कि निकटता की दर (यहाँ 95%) से आशय यह है कि कितनी बार कोई सैंपल ऐसा चुना जाएगा जो population parameter के क़रीब हो. आप कभी पक्का नहीं जान पाएँगे कि कोई विशेष dataset parameter के क़रीब है या दूर, लेकिन आप यह ज़रूर जानते हैं कि लंबे समय में, आपके जुटाए गए 95% नमूने ऐसे अनुमान देंगे जो true population parameter से \(2SE\) के भीतर हों.
एक एकल poll के वोट, one_poll, और 1000 bootstrap resamples के डेटा, one_poll_boot, आपके workspace में उपलब्ध हैं. ये इस अध्याय के पहले के Experiment 2 पर आधारित हैं.
पिछले अभ्यास की तरह, जब किसी statistic की variability की बात होती है, तो उस संख्या को standard error कहा जाता है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में Inference की बुनियाद
अभ्यास निर्देश
- \(\hat{p}\) निकालें और परिणाम को
p_hatमें असाइन करें.summarize()की कॉल में,statकोvoteके"yes"होने के mean के रूप में calculate करें. - \(\hat{p} \pm 2SE\) की गणना करके true parameter के लिए संभाव्य मूल्यों का एक interval निकालें.
- confidence interval की
lowerसीमाp_hatमाइनसstatके standard error का दोगुना है. standard error निकालने के लिएsd()का उपयोग करें. upperसीमाp_hatप्लस standard error का दोगुना है.
- confidence interval की
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# From previous exercises
one_poll <- all_polls %>%
filter(poll == 1) %>%
select(vote)
one_poll_boot <- one_poll %>%
specify(response = vote, success = "yes") %>%
generate(reps = 1000, type = "bootstrap") %>%
calculate(stat = "prop")
p_hat <- one_poll %>%
# Calculate proportion of yes votes
summarize(stat = ___) %>%
pull()
# Create an interval of plausible values
one_poll_boot %>%
summarize(
# Lower bound is p_hat minus 2 std errs
lower = ___,
# Upper bound is p_hat plus 2 std errs
upper = ___
)