शुरू करेंमुफ़्त में शुरू करें

एग्रीगेटिंग

सामान्य एग्रीगेशन मेथड जैसे .min(), .max(), और .count() — ये सभी GroupedData के मेथड हैं। इन्हें DataFrame के .groupBy() मेथड को कॉल करके बनाया जाता है। अगले कुछ अभ्यासों में आप ठीक-ठीक सीखेंगे कि इसका मतलब क्या है। फिलहाल, इन फंक्शंस का उपयोग करने के लिए आपको बस अपने DataFrame पर यह मेथड कॉल करना है। उदाहरण के लिए, किसी DataFrame df में कॉलम col का न्यूनतम मान निकालने के लिए आप यह कर सकते हैं:

df.groupBy().min("col").show()

यह एक GroupedData ऑब्जेक्ट बनाता है (ताकि आप .min() मेथड का उपयोग कर सकें), फिर col में न्यूनतम मान ढूँढता है और उसे एक DataFrame के रूप में लौटाता है।

अब आप खुद कुछ एग्रीगेशन करने के लिए तैयार हैं!

आपके वर्कस्पेस में spark नाम का एक SparkSession पहले से मौजूद है, साथ ही Spark DataFrame flights भी है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark की नींव

पाठ्यक्रम देखें

अभ्यास निर्देश

  • PDX से उड़ी सबसे छोटी (distance के अनुसार) उड़ान की लंबाई पता कीजिए: पहले .filter() लगाएँ और फिर .min() मेथड का उपयोग करें। फ़िल्टरिंग करते समय कॉलम को सीधे संदर्भित करें, कोई SQL स्ट्रिंग पास न करें.
  • SEA से उड़ी सबसे लंबी (समय के अनुसार) उड़ान की लंबाई पता कीजिए: filter() लगाएँ और .max() मेथड का उपयोग करें। फ़िल्टरिंग करते समय कॉलम को सीधे संदर्भित करें, कोई SQL स्ट्रिंग पास न करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Find the shortest flight from PDX in terms of distance
flights.filter(____.____ == ____).groupBy().____(____).show()

# Find the longest flight from SEA in terms of air time
flights.filter(____).groupBy().____.show()
कोड संपादित करें और चलाएँ