शुरू करेंमुफ़्त में शुरू करें

Corr() का उपयोग

पुरानी कहावत 'Correlation does not imply Causation' एक सावधान करने वाली बात है. फिर भी, correlation हमें यह संकेत देता है कि अपने मॉडलों के लिए उपयोगी फीचर कहाँ से तलाशना शुरू करें. इस अभ्यास में आप अपने डेटा को पहली बार टटोलते हुए पैटर्न खोजने का अभ्यास करेंगे.

आपके लिए कॉलम नामों की एक लिस्ट columns बनाई गई है. इस अभ्यास में आप इन कॉलम्स और 'SALESCLOSEPRICE' के बीच correlation निकालेंगे, और अधिकतम मान ढूँढेंगे.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Feature Engineering

पाठ्यक्रम देखें

अभ्यास निर्देश

  • for लूप का उपयोग करके columns पर iterate करें.
  • हर लूप चक्र में, वर्तमान कॉलम और 'SALESCLOSEPRICE' के बीच correlation corr() मेथड से निकालें.
  • ऐसी लॉजिक लिखें जो अधिकतम दिखे हुए correlation और वह किस कॉलम में है, उसे अपडेट करे.
  • उस कॉलम का नाम प्रिंट करें जिसका 'SALESCLOSEPRICE' के साथ अधिकतम correlation है.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Name and value of col with max corr
corr_max = 0
corr_max_col = columns[0]

# Loop to check all columns contained in list
for ____ in ____:
    # Check the correlation of a pair of columns
    corr_val = df.____(____, ____)
    # Logic to compare corr_max with current corr_val
    if ____ ____ ____:
        # Update the column name and corr value
        corr_max = corr_val
        corr_max_col = col

print(corr_max_col)
कोड संपादित करें और चलाएँ