ÎncepețiÎncepe gratuit

Stocarea unui DataFrame în cache

Ai primit o sarcină care presupune rularea mai multor operații de analiză pe un DataFrame. Ai aflat că stocarea în cache poate îmbunătăți performanța atunci când reutilizezi DataFrame-uri și vrei să implementezi această tehnică.

Vei lucra cu un nou set de date care conține informații despre plecările avioanelor. Este posibil să conțină date duplicate, care vor trebui eliminate.

DataFrame-ul departures_df este definit, dar nu a fost efectuată nicio acțiune asupra lui.

Acest exercițiu face parte din cursul

Curățarea datelor cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Stochează în cache rândurile unice din DataFrame-ul departures_df.
  • Execută o interogare de numărare pe departures_df și observă cât timp durează operația.
  • Numără rândurile din nou și observă diferența de timp pentru un DataFrame stocat în cache.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

start_time = time.time()

# Add caching to the unique rows in departures_df
departures_df = departures_df.____.____

# Count the unique rows in departures_df, noting how long the operation takes
print("Counting %d rows took %f seconds" % (departures_df.____, time.time() - start_time))

# Count the rows again, noting the variance in time of a cached DataFrame
start_time = time.time()
print("Counting %d rows again took %f seconds" % (____, time.time() - start_time))
Editează și rulează codul