Stocarea unui DataFrame în cache
Ai primit o sarcină care presupune rularea mai multor operații de analiză pe un DataFrame. Ai aflat că stocarea în cache poate îmbunătăți performanța atunci când reutilizezi DataFrame-uri și vrei să implementezi această tehnică.
Vei lucra cu un nou set de date care conține informații despre plecările avioanelor. Este posibil să conțină date duplicate, care vor trebui eliminate.
DataFrame-ul departures_df este definit, dar nu a fost efectuată nicio acțiune asupra lui.
Acest exercițiu face parte din cursul
Curățarea datelor cu PySpark
Instrucțiuni pentru exercițiu
- Stochează în cache rândurile unice din DataFrame-ul
departures_df. - Execută o interogare de numărare pe
departures_dfși observă cât timp durează operația. - Numără rândurile din nou și observă diferența de timp pentru un DataFrame stocat în cache.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
start_time = time.time()
# Add caching to the unique rows in departures_df
departures_df = departures_df.____.____
# Count the unique rows in departures_df, noting how long the operation takes
print("Counting %d rows took %f seconds" % (departures_df.____, time.time() - start_time))
# Count the rows again, noting the variance in time of a cached DataFrame
start_time = time.time()
print("Counting %d rows again took %f seconds" % (____, time.time() - start_time))