शुरू करेंमुफ़्त में शुरू करें

Caching का अभ्यास: सबको एक साथ जोड़ना

df1 और df2 को cache करने का सबसे अच्छा तरीका क्या था और क्यों?

आपके परिणाम अलग हो सकते हैं; लेकिन यहाँ दोनों तरीकों के लिए एक-एक (रैंडम) परिणाम दिया है:

पहला उत्तर (df1 को cache करें):

df1_1st : 2.4s
df1_2nd : 0.1s
df2_1st : 0.3s
df2_2nd : 0.2s
Overall elapsed : 3.9

दूसरा उत्तर (df2 को cache करें):

df1_1st : 2.3s
df1_2nd : 1.1s
df2_1st : 1.7s
df2_2nd : 0.1s
Overall elapsed : 6.4

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Spark SQL परिचय

पाठ्यक्रम देखें

इंटरैक्टिव व्यावहारिक अभ्यास

हमारे इंटरैक्टिव अभ्यासों में से किसी एक के साथ सिद्धांत को व्यवहार में बदलें

अभ्यास शुरू करें