Empirical Rule
डेटा विश्लेषण में हम जिन कई सांख्यिकी का उपयोग करते हैं (जैसे सैंपल औसत और सैंपल प्रोपोर्शन), उनमें कुछ अच्छी विशेषताएँ होती हैं जो रुचि वाले पॉप्युलेशन पैरामीटर को बेहतर समझने में मदद करती हैं.
ऐसी ही एक विशेषता यह है कि यदि सैंपल प्रोपोर्शन की वैरिएबिलिटी (जिसे standard error या \(SE\) कहा जाता है) ज्ञात हो, तो लगभग 95% \(\hat{p}\) मान (अलग-अलग सैंपल से) सही पॉप्युलेशन प्रोपोर्शन से \(2SE\) के भीतर होंगे.
यह जाँचने के लिए कि क्या यह बात यहाँ लागू होती है, आइए उसी पॉप्युलेशन से कई सैंपल लेकर बनाए गए पोल्स पर वापस चलते हैं.
all_polls डेटासेट में 1000 सैंपल हैं, प्रत्येक का आकार 30 है, और पॉप्युलेशन में Candidate X को वोट देने की प्रॉबेबिलिटी 0.6 है.
ध्यान दें कि आप R फंक्शन sd() का उपयोग करेंगे जो किसी भी संख्याओं के सेट की वैरिएबिलिटी निकालता है। सांख्यिकी में, जब sd() किसी वैरिएबल (उदा., house की price) पर लगाते हैं तो इसे standard deviation कहते हैं। जब sd() किसी statistic (उदा., सैंपल प्रोपोर्शन्स के सेट) पर लगाते हैं तो इसे standard error कहते हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में Inference की बुनियाद
अभ्यास निर्देश
- कोड चलाएँ ताकि
propsजेनरेट हो, जो हर पोल में उन व्यक्तियों का proportion है जो yes वोट करने की योजना बना रहे हैं। यह पिछले अभ्यासों केex1_propsपर आधारित है. - एक कॉलम जोड़ें,
is_in_conf_int, जोTRUEहो जब yes वोट के सैंपल प्रोपोर्शन, सही पॉप्युलेशन प्रोपोर्शन से2standard errors से कम दूरी पर हो। अर्थात्prop_yesऔरtrue_prop_yesके बीच काabs()olute अंतर,prop_yesकेsd()के दोगुने से कम हो. - कॉन्फिडेंस इंटरवल में आने वाले सैंपल स्टैटिस्टिक्स का proportion,
prop_in_conf_int,is_in_conf_intकाmean()लेकर निकालें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Proportion of yes votes by poll
props <- all_polls %>%
group_by(poll) %>%
summarize(prop_yes = mean(vote == "yes"))
# The true population proportion of yes votes
true_prop_yes <- 0.6
# Proportion of polls within 2SE
props %>%
# Add column: is prop_yes in 2SE of 0.6
mutate(is_in_conf_int = ___(___ - ___) < ___ * ___(___)) %>%
# Calculate proportion in conf int
summarize(prop_in_conf_int = ___(___))