Correlation की मज़बूती
सहज रूप से, हम दिए गए प्लॉट्स को देखकर "समझ" सकते हैं कि क्या दो वैरिएबल साथ-साथ "बदलते" दिखते हैं.
- Data Set A: x और y साथ बदलते हैं और उनके बीच मज़बूत संबंध दिखता है.
- Data Set B: हल्का ऊपर की ओर ट्रेंड है; x और y ढीले-ढाले रूप से संबंधित लगते हैं.
- Data Set C: रैंडम बिखराव जैसा दिखता है; x और y साथ नहीं बदलते और असंबंधित हैं.



याद करें कि deviations, mean से अंतर होते हैं, और हमने deviations को standard deviation से भाग देकर normalize किया था। इस अभ्यास में आप 3 डेटा सेट्स की तुलना correlation निकालकर करेंगे और तय करेंगे कि किस डेटा सेट में x और y सबसे मज़बूती से correlated हैं। दिए गए डेटा टेबल data_sets का उपयोग करें, जो रिकॉर्ड्स की एक dictionary है, जिनमें 'name', 'x', 'y', और 'correlation' की keys हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Linear Modeling परिचय
अभ्यास निर्देश
correlation()फंक्शन की परिभाषा पूरी करें:xऔरyके normalized deviations के गुणनों के mean का उपयोग करें.data_setsपर iterate करें, और हर correlation कोcorrelation(record['x'], record['y'])से निकालकर स्टोर करें.- यहाँ तक का कोड चलाइए (अर्थात् for लूप के अंत तक) और प्रिंटआउट देखें। किस डेटासेट में सबसे मज़बूत correlation है?
- सबसे मज़बूत correlation वाले डेटासेट का नाम (
data_sets['A'],data_sets['B'], याdata_sets['C']) वैरिएबलbest_dataको असाइन करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Complete the function that will compute correlation.
def correlation(x,y):
x_dev = x - np.____(x)
y_dev = y - np.____(y)
x_norm = x_dev / np.____(x)
y_norm = y_dev / np.____(y)
return np.____(x_norm * y_norm)
# Compute and store the correlation for each data set in the list.
for name, data in data_sets.items():
data['correlation'] = ____(data['x'], data['y'])
print('data set {} has correlation {:.2f}'.format(name, data['correlation']))
# Assign the data set with the best correlation.
best_data = data_sets['____']