Exersăm caching-ul: totul împreună
Care a fost cea mai bună abordare pentru memorarea în cache a df1 și df2 și de ce?
Rezultatele tale pot varia; iată un rezultat (aleatoriu) pentru fiecare dintre cele două abordări:
Primul răspuns (cache df1):
df1_1st : 2.4s
df1_2nd : 0.1s
df2_1st : 0.3s
df2_2nd : 0.2s
Overall elapsed : 3.9
Al doilea răspuns (cache df2):
df1_1st : 2.3s
df1_2nd : 1.1s
df2_1st : 1.7s
df2_2nd : 0.1s
Overall elapsed : 6.4
Acest exercițiu face parte din cursul
Introducere în Spark SQL în Python
Exercițiu interactiv practic
Transformă teoria în practică cu unul dintre exercițiile noastre interactive
Începe exercițiul