Corr() का उपयोग
पुरानी कहावत 'Correlation does not imply Causation' एक सावधान करने वाली बात है. फिर भी, correlation हमें यह संकेत देता है कि अपने मॉडलों के लिए उपयोगी फीचर कहाँ से तलाशना शुरू करें. इस अभ्यास में आप अपने डेटा को पहली बार टटोलते हुए पैटर्न खोजने का अभ्यास करेंगे.
आपके लिए कॉलम नामों की एक लिस्ट columns बनाई गई है. इस अभ्यास में आप इन कॉलम्स और 'SALESCLOSEPRICE' के बीच correlation निकालेंगे, और अधिकतम मान ढूँढेंगे.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Feature Engineering
अभ्यास निर्देश
forलूप का उपयोग करकेcolumnsपर iterate करें.- हर लूप चक्र में, वर्तमान कॉलम और
'SALESCLOSEPRICE'के बीच correlationcorr()मेथड से निकालें. - ऐसी लॉजिक लिखें जो अधिकतम दिखे हुए correlation और वह किस कॉलम में है, उसे अपडेट करे.
- उस कॉलम का नाम प्रिंट करें जिसका
'SALESCLOSEPRICE'के साथ अधिकतम correlation है.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Name and value of col with max corr
corr_max = 0
corr_max_col = columns[0]
# Loop to check all columns contained in list
for ____ in ____:
# Check the correlation of a pair of columns
corr_val = df.____(____, ____)
# Logic to compare corr_max with current corr_val
if ____ ____ ____:
# Update the column name and corr value
corr_max = corr_val
corr_max_col = col
print(corr_max_col)