शुरू करेंमुफ़्त में शुरू करें

Joins II

PySpark में joins, DataFrame की मेथड .join() से किए जाते हैं। यह मेथड तीन आर्ग्युमेंट लेती है। पहला, वह दूसरा DataFrame है जिसे आप पहले वाले के साथ जोड़ना चाहते हैं। दूसरा आर्ग्युमेंट on है, जो key कॉलम/कॉलमों का नाम string के रूप में होता है। key कॉलमों के नाम दोनों टेबलों में समान होने चाहिए। तीसरा आर्ग्युमेंट how यह निर्धारित करता है कि किस प्रकार का join करना है। इस कोर्स में हम हमेशा how="leftouter" का मान ही उपयोग करेंगे।

flights डेटासेट और airports नाम का एक नया डेटासेट पहले से ही आपके वर्कस्पेस में मौजूद है।

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark की नींव

पाठ्यक्रम देखें

अभ्यास निर्देश

  • airports DataFrame को .show() चलाकर देखें। नोट करें कि कौन सा key कॉलम airports को flights टेबल से जोड़ने देगा।
  • airports.withColumnRenamed("faa", "dest") के परिणाम को airports में ही दोबारा असाइन करके, airports में faa कॉलम का नाम बदलकर dest रखिए।
  • .join() मेथड को flights पर कॉल करके, dest कॉलम पर flights को airports DataFrame से जोड़िए। परिणाम को flights_with_airports नाम से सेव करें।
    • पहला आर्ग्युमेंट दूसरा DataFrame airports होना चाहिए।
    • on आर्ग्युमेंट में key कॉलम दें।
    • how आर्ग्युमेंट "leftouter" होना चाहिए।
  • डेटा दोबारा देखने के लिए flights_with_airports पर .show() चलाइए। जो नई जानकारी जुड़ी है, उस पर ध्यान दें।

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Examine the data
print(____)

# Rename the faa column
airports = ____

# Join the DataFrames
flights_with_airports = ____

# Examine the new DataFrame
print(____)
कोड संपादित करें और चलाएँ