Multiple comparisons समस्या
Multiple comparisons समस्या तब आती है जब कोई शोधकर्ता बार-बार अलग-अलग वैरिएबल्स/सैंपल्स के बीच महत्व (significance) की जाँच करता/करती है। केवल रैंडम संयोग से भी हम कभी-कभी सांख्यिकीय रूप से महत्वपूर्ण परिणाम मिलने की उम्मीद करते हैं.
इस अभ्यास में आप ऑस्टिन, TX शहर के कर्मचारियों के वेतन डेटा के साथ काम करेंगे। आप उनके वेतन की तुलना रैंडम जनरेट किए गए डेटा से करेंगे। आप देखेंगे कि यह रैंडम डेटा कर्मचारियों के वेतन को समझाने में कितनी बार "significant" निकलता है। साफ़ है कि ऐसी कोई भी "significance" भ्रामक होगी, क्योंकि रैंडम नंबर किसी चीज़ को समझाने में ज़्यादा मददगार नहीं होते!
आपके लिए पुलिस अधिकारियों के वेतन का DataFrame (police_salaries_df) लोड किया गया है, और पैकेज pandas pd के रूप में, NumPy np के रूप में, Matplotlib plt के रूप में, और SciPy से stats भी लोड हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में अनुमान का आधार
अभ्यास निर्देश
- डेटासेट में लोगों की संख्या (हर पंक्ति एक व्यक्ति है) को
n_rowsमें स्टोर करें, और महत्वपूर्ण नतीजों की गिनतीn_significantको शून्य से प्रारंभ करें. - एक
forलूप लिखिए जो 1000 बार चले और हर बारn_rowsरैंडम नंबर जनरेट करे. - इन रैंडम नंबरों और पुलिस अधिकारियों के वेतन के बीच Pearson's R और उससे जुड़ी p-value की गणना करें.
- अगर p-value 5% स्तर पर significant हो, तो
+=ऑपरेटर का उपयोग करकेn_significantमें 1 जोड़ दें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Compute number of rows and initialize n_significant
n_rows = ____
n_significant = ____
# For loop which generates n_rows random numbers 1000 times
for i in ____:
random_nums = np.random.uniform(size=____)
# Compute correlation between random_nums and police salaries
r, p_value = stats.____(____, random_nums)
# If the p-value is significant at 5%, increment n_significant
if ____ < ____:
____ += 1
print(n_significant)