कैशिंग का अभ्यास: भाग 1
अगले कुछ अभ्यासों में, आप दो DataFrames को cache करने के अलग-अलग तरीकों के साथ प्रयोग करेंगे.
एक dataframe df1 एक CSV फ़ाइल से लोड किया गया है। इस पर कई प्रोसेसिंग स्टेप्स चलाए गए हैं। क्योंकि df1 का उपयोग एक से अधिक बार होना है, यह cache करने के लिए उपयुक्त है.
दूसरा dataframe df2 df1 पर अतिरिक्त, compute-intensive स्टेप्स चलाकर बनाया गया है। यह भी cache करने के लिए उपयुक्त है.
क्योंकि df2 df1 पर निर्भर है, सवाल उठता है: df1 को cache करना बेहतर है, या df2 को?
इस अभ्यास में, हम df1 को cache करने की कोशिश करेंगे। हर action में लगने वाला समय नोट करें। अगली कसरत में हम इनकी तुलना करेंगे.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Spark SQL परिचय
अभ्यास निर्देश
- केवल
df1को cache करें. df1पर एक action चलाएँ और उसे दोहराएँ, फिरdf2पर एक action चलाएँ और उसे दोहराएँ। यह आपके लिए कर दिया गया है.- पुष्टि करें कि
df1cached है या नहीं.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Unpersists df1 and df2 and initializes a timer
prep(df1, df2)
# Cache df1
____
# Run actions on both dataframes
run(df1, "df1_1st")
run(df1, "df1_2nd")
run(df2, "df2_1st")
run(df2, "df2_2nd", elapsed=True)
# Prove df1 is cached
print(____)