Caching का अभ्यास: सबको एक साथ जोड़ना
df1 और df2 को cache करने का सबसे अच्छा तरीका क्या था और क्यों?
आपके परिणाम अलग हो सकते हैं; लेकिन यहाँ दोनों तरीकों के लिए एक-एक (रैंडम) परिणाम दिया है:
पहला उत्तर (df1 को cache करें):
df1_1st : 2.4s
df1_2nd : 0.1s
df2_1st : 0.3s
df2_2nd : 0.2s
Overall elapsed : 3.9
दूसरा उत्तर (df2 को cache करें):
df1_1st : 2.3s
df1_2nd : 1.1s
df2_1st : 1.7s
df2_2nd : 0.1s
Overall elapsed : 6.4
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Spark SQL परिचय
इंटरैक्टिव व्यावहारिक अभ्यास
हमारे इंटरैक्टिव अभ्यासों में से किसी एक के साथ सिद्धांत को व्यवहार में बदलें
अभ्यास शुरू करें