शुरू करेंमुफ़्त में शुरू करें

Hypothesis testing - औसतों का अंतर

हम यह परिकल्पना जाँचना चाहते हैं कि A और B से प्राप्त औसत डोनेशन्स में अंतर है। पहले, आपने डेटा का एक permutation कैसे जनरेट करना है, यह सीखा था। अब, हम means के अंतर का एक null distribution बनाएँगे और फिर p-value निकालेंगे.

Null distribution के लिए, हम पहले कई permuted datasets जनरेट करते हैं और हर केस के लिए means का अंतर सहेजते हैं। फिर हम मूल डेटासेट के साथ means के अंतर को टेस्ट स्टैटिस्टिक के रूप में निकालते हैं। अंत में, हम p-value का अनुमान इस तरह लगाते हैं: उन केसेज़ के अनुपात का दोगुना जहाँ अंतर, टेस्ट स्टैटिस्टिक के परिमाण (absolute value) से बड़ा या बराबर है (2-sided hypothesis)। लगभग 0.05 से कम p-value होने पर हम सांख्यिकीय महत्व (statistical significance) मान सकते हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Statistical Simulation

पाठ्यक्रम देखें

अभ्यास निर्देश

  • donations_A और donations_B के कई permutations जनरेट करें और उसे perm में असाइन करें.
  • samples को permuted_A_datasets और permuted_B_datasets के means के अंतर के बराबर सेट करें। हम axis=1 इसलिए रखते हैं ताकि हर डेटासेट का अलग mean निकले, न कि कुल मिलाकर एक mean.
  • test_stat को donations_A और donations_B के means के अंतर के बराबर सेट करें.
  • p-value p_val की गणना इस तरह करें: samples का वह अंश जो test_stat के परिमाण (absolute value) से बड़ा या बराबर है, उसका दोगुना.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Generate permutations equal to the number of repetitions
perm = np.array([np.random.____(len(____) + len(____)) for i in range(reps)])
permuted_A_datasets = data[perm[:, :len(donations_A)]]
permuted_B_datasets = data[perm[:, len(donations_A):]]

# Calculate the difference in means for each of the datasets
samples = np.mean(____, axis=1) - np.mean(____, axis=1)

# Calculate the test statistic and p-value
test_stat = ____
p_val = 2*np.sum(____ >= np.abs(____))/reps
print("p-value = {}".format(p_val))
कोड संपादित करें और चलाएँ