शुरू करेंमुफ़्त में शुरू करें

कैशिंग का अभ्यास: SQL

पहले, हमने दो DataFrames देखे थे: df1 और df2 (जो df1 से बनाया गया है)। हमने df1 को cache करने की कोशिश की थी, लेकिन df2 को नहीं। इस अभ्यास में, हम df2 को cache करने के असर देखेंगे, लेकिन df1 को नहीं।

एक बार फिर, ध्यान दें कि हर action में कितना समय लगता है। हम इनकी तुलना अगले अभ्यास में करेंगे। कौन-से tasks तेज़ होते हैं? कौन-से धीमे हो जाते हैं?

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Spark SQL परिचय

पाठ्यक्रम देखें

अभ्यास निर्देश

  • df2 को cache करें, लेकिन df1 को नहीं।
  • df1 पर एक पहली action चलाएँ और उसे दोहराएँ, फिर df2 पर भी एक action चलाएँ और उसे दोहराएँ। यह आपके लिए पहले से किया गया है.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Unpersist df1 and df2 and initializes a timer
prep(df1, df2) 

# Persist df2 using memory and disk storage level 
df2.persist(____)

# Run actions both dataframes
run(df1, "df1_1st") 
run(df1, "df1_2nd") 
run(df2, "df2_1st") 
run(df2, "df2_2nd", elapsed=True)
कोड संपादित करें और चलाएँ