शुरू करेंमुफ़्त में शुरू करें

DataFrame को कैश करना

आपको एक ऐसा कार्य सौंपा गया है जिसमें एक DataFrame पर कई विश्लेषण ऑपरेशंस चलाने की ज़रूरत है. आपने सीखा है कि जब आप DataFrames को दोबारा उपयोग करते हैं तो कैशिंग परफ़ॉर्मेंस बेहतर कर सकती है, और आप इसे लागू करना चाहते हैं.

आप एक नए डेटासेट के साथ काम करेंगे जिसमें एयरलाइन डिपार्चर की जानकारी है. इसमें दोहराए गए डेटा हो सकते हैं, जिन्हें डी-डुप्लिकेट करना पड़ेगा.

DataFrame departures_df परिभाषित है, लेकिन अभी तक कोई एक्शन नहीं चलाया गया है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ डेटा क्लीनिंग

पाठ्यक्रम देखें

अभ्यास निर्देश

  • departures_df DataFrame में यूनिक पंक्तियों को कैश करें.
  • departures_df पर एक count क्वेरी चलाएँ और देखें कि ऑपरेशन में कितना समय लगता है.
  • पंक्तियों को फिर से गिनें और कैश किए गए DataFrame में समय के अंतर को नोट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

start_time = time.time()

# Add caching to the unique rows in departures_df
departures_df = departures_df.____.____

# Count the unique rows in departures_df, noting how long the operation takes
print("Counting %d rows took %f seconds" % (departures_df.____, time.time() - start_time))

# Count the rows again, noting the variance in time of a cached DataFrame
start_time = time.time()
print("Counting %d rows again took %f seconds" % (____, time.time() - start_time))
कोड संपादित करें और चलाएँ