Grouping और Aggregating II
GroupedData मेथड्स के अलावा जो आप अभी तक देख चुके हैं, एक .agg() मेथड भी होता है.
यह मेथड आपको एक aggregate कॉलम expression पास करने देता है, जो pyspark.sql.functions सबमॉड्यूल के किसी भी aggregate फंक्शन का उपयोग कर सकता है.
इस सबमॉड्यूल में standard deviation जैसी गणनाएँ करने के लिए कई उपयोगी फंक्शन हैं. इस सबमॉड्यूल के सभी aggregation फंक्शन GroupedData टेबल में किसी कॉलम का नाम इनपुट के रूप में लेते हैं.
ध्यान रखें, spark नाम का एक SparkSession पहले से आपके वर्कस्पेस में मौजूद है, साथ ही Spark DataFrame flights भी. पिछले अभ्यास में आपने जो grouped DataFrames बनाए थे, वे भी आपके वर्कस्पेस में हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark की नींव
अभ्यास निर्देश
- सबमॉड्यूल
pyspark.sql.functionsकोFनाम से इम्पोर्ट करें. by_month_destनाम की एकGroupedDataटेबल बनाएँ, जोmonthऔरdestदोनों कॉलम पर group की गई हो. दोनों कॉलम के लिए दोनों strings को अलग-अलग आर्गुमेंट्स के रूप में पास करें.by_month_destDataFrame पर.avg()मेथड का उपयोग करके हर destination के लिए हर महीने का औसतdep_delayनिकालें..agg()मेथड में फंक्शनF.stddev()का उपयोग करकेdep_delayका standard deviation निकालें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import pyspark.sql.functions as F
import ____ as F
# Group by month and dest
by_month_dest = flights.groupBy(____)
# Average departure delay by month and destination
by_month_dest.____.show()
# Standard deviation of departure delay
by_month_dest.agg(F.____(____)).show()