कैशिंग का अभ्यास: SQL
पहले, हमने दो DataFrames देखे थे: df1 और df2 (जो df1 से बनाया गया है)। हमने df1 को cache करने की कोशिश की थी, लेकिन df2 को नहीं। इस अभ्यास में, हम df2 को cache करने के असर देखेंगे, लेकिन df1 को नहीं।
एक बार फिर, ध्यान दें कि हर action में कितना समय लगता है। हम इनकी तुलना अगले अभ्यास में करेंगे। कौन-से tasks तेज़ होते हैं? कौन-से धीमे हो जाते हैं?
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Spark SQL परिचय
अभ्यास निर्देश
df2को cache करें, लेकिनdf1को नहीं।df1पर एक पहली action चलाएँ और उसे दोहराएँ, फिरdf2पर भी एक action चलाएँ और उसे दोहराएँ। यह आपके लिए पहले से किया गया है.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Unpersist df1 and df2 and initializes a timer
prep(df1, df2)
# Persist df2 using memory and disk storage level
df2.persist(____)
# Run actions both dataframes
run(df1, "df1_1st")
run(df1, "df1_2nd")
run(df2, "df2_1st")
run(df2, "df2_2nd", elapsed=True)