शुरू करेंमुफ़्त में शुरू करें

Grouping और Aggregating II

GroupedData मेथड्स के अलावा जो आप अभी तक देख चुके हैं, एक .agg() मेथड भी होता है. यह मेथड आपको एक aggregate कॉलम expression पास करने देता है, जो pyspark.sql.functions सबमॉड्यूल के किसी भी aggregate फंक्शन का उपयोग कर सकता है.

इस सबमॉड्यूल में standard deviation जैसी गणनाएँ करने के लिए कई उपयोगी फंक्शन हैं. इस सबमॉड्यूल के सभी aggregation फंक्शन GroupedData टेबल में किसी कॉलम का नाम इनपुट के रूप में लेते हैं.

ध्यान रखें, spark नाम का एक SparkSession पहले से आपके वर्कस्पेस में मौजूद है, साथ ही Spark DataFrame flights भी. पिछले अभ्यास में आपने जो grouped DataFrames बनाए थे, वे भी आपके वर्कस्पेस में हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark की नींव

पाठ्यक्रम देखें

अभ्यास निर्देश

  • सबमॉड्यूल pyspark.sql.functions को F नाम से इम्पोर्ट करें.
  • by_month_dest नाम की एक GroupedData टेबल बनाएँ, जो month और dest दोनों कॉलम पर group की गई हो. दोनों कॉलम के लिए दोनों strings को अलग-अलग आर्गुमेंट्स के रूप में पास करें.
  • by_month_dest DataFrame पर .avg() मेथड का उपयोग करके हर destination के लिए हर महीने का औसत dep_delay निकालें.
  • .agg() मेथड में फंक्शन F.stddev() का उपयोग करके dep_delay का standard deviation निकालें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Import pyspark.sql.functions as F
import ____ as F

# Group by month and dest
by_month_dest = flights.groupBy(____)

# Average departure delay by month and destination
by_month_dest.____.show()

# Standard deviation of departure delay
by_month_dest.agg(F.____(____)).show()
कोड संपादित करें और चलाएँ