PySpark में groupBy
आपने देखा कि dask फ्रेमवर्क और उसकी DataFrame एब्स्ट्रैक्शन का उपयोग करके कैलकुलेशन कैसे किए जाते हैं. हालाँकि, जैसा कि आपने वीडियो में देखा, बिग डेटा की दुनिया में डेटा प्रोसेसिंग के लिए Spark शायद और भी लोकप्रिय विकल्प है.
इस अभ्यास में, आप PySpark पैकेज का उपयोग करके एक Spark DataFrame पर काम करेंगे. डेटा वही है जो पिछले अभ्यासों में था: 1896 से 2016 के बीच के ओलंपिक इवेंट्स के प्रतिभागी.
Spark DataFrame athlete_events_spark आपके वर्कस्पेस में उपलब्ध है.
इस अभ्यास में आप जिन मेथड्स का उपयोग करेंगे, वे हैं:
.printSchema(): Spark DataFrame का स्कीमा प्रिंट करने में मदद करता है..groupBy(): एग्रीगेशन के लिए ग्रुपिंग स्टेटमेंट..mean(): हर ग्रुप पर औसत लेता है..show(): परिणाम दिखाता है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Introduction to Data Engineering
अभ्यास निर्देश
athlete_events_sparkका टाइप पता करें.athlete_events_sparkका स्कीमा देखें.- ओलंपियन की औसत आयु को वर्ष के आधार पर ग्रुप करके प्रिंट करें. ध्यान दें कि Spark ने अभी वास्तव में कुछ कैलकुलेट नहीं किया है. इसे आप lazy evaluation कह सकते हैं.
- पिछले परिणाम पर
.show()कॉल करें ताकि औसत आयु कैलकुलेट होकर दिखाई दे.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Print the type of athlete_events_spark
print(____(athlete_events_spark))
# Print the schema of athlete_events_spark
print(athlete_events_spark.____())
# Group by the Year, and find the mean Age
print(athlete_events_spark.____('Year').mean(____))
# Group by the Year, and find the mean Age
print(athlete_events_spark.____('Year').mean(____).____())