शुरू करेंमुफ़्त में शुरू करें

कैशिंग का अभ्यास: भाग 1

अगले कुछ अभ्यासों में, आप दो DataFrames को cache करने के अलग-अलग तरीकों के साथ प्रयोग करेंगे.

एक dataframe df1 एक CSV फ़ाइल से लोड किया गया है। इस पर कई प्रोसेसिंग स्टेप्स चलाए गए हैं। क्योंकि df1 का उपयोग एक से अधिक बार होना है, यह cache करने के लिए उपयुक्त है.

दूसरा dataframe df2 df1 पर अतिरिक्त, compute-intensive स्टेप्स चलाकर बनाया गया है। यह भी cache करने के लिए उपयुक्त है.

क्योंकि df2 df1 पर निर्भर है, सवाल उठता है: df1 को cache करना बेहतर है, या df2 को?

इस अभ्यास में, हम df1 को cache करने की कोशिश करेंगे। हर action में लगने वाला समय नोट करें। अगली कसरत में हम इनकी तुलना करेंगे.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Spark SQL परिचय

पाठ्यक्रम देखें

अभ्यास निर्देश

  • केवल df1 को cache करें.
  • df1 पर एक action चलाएँ और उसे दोहराएँ, फिर df2 पर एक action चलाएँ और उसे दोहराएँ। यह आपके लिए कर दिया गया है.
  • पुष्टि करें कि df1 cached है या नहीं.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Unpersists df1 and df2 and initializes a timer
prep(df1, df2) 

# Cache df1
____

# Run actions on both dataframes
run(df1, "df1_1st") 
run(df1, "df1_2nd")
run(df2, "df2_1st")
run(df2, "df2_2nd", elapsed=True)

# Prove df1 is cached
print(____)
कोड संपादित करें और चलाएँ