Lazy processing का उपयोग
Lazy processing ऑपरेशंस आम तौर पर लगभग उतने ही समय में लौटते हैं, भले ही वास्तविक डेटा की मात्रा अलग क्यों न हो. ध्यान रखें कि ऐसा इसलिए है क्योंकि Spark किसी action के अनुरोध तक कोई transformation निष्पादित नहीं करता.
इस अभ्यास में, हम एक Data Frame (aa_dfw_df) परिभाषित करेंगे और कुछ transformations जोड़ेंगे. जब transformations केवल परिभाषित किए गए हों बनाम जब डेटा को वास्तव में क्वेरी किया जाए, तो पूरा होने में लगे समय पर ध्यान दें. ये अंतर छोटे हो सकते हैं, लेकिन नज़र आएँगे. जब आप बड़े डेटा के साथ पूर्ण Spark क्लस्टर पर काम करेंगे, तो यह अंतर और स्पष्ट होगा.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ डेटा क्लीनिंग
अभ्यास निर्देश
- Data Frame लोड करें.
Destination Airportकॉलम परF.lower()का transformation जोड़ें.- Data Frame को दिखाएँ और इस action के पूरा होने में लगे समय के अंतर पर ध्यान दें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Load the CSV file
aa_dfw_df = ____.____.____('csv').options(Header=True).load('AA_DFW_2018.csv.gz')
# Add the airport column using the F.lower() method
aa_dfw_df = aa_dfw_df.withColumn('airport', ____(aa_dfw_df['Destination Airport']))
# Show the DataFrame
____