Začněte nyníZačněte zdarma

Cachování DataFrame

Dostal/a jsi za úkol provést několik analytických operací nad DataFrame. Víš už, že cachování může zlepšit výkon při opakovaném používání DataFramů, a chceš ho teď využít v praxi.

Budeš pracovat s novým datasetem obsahujícím informace o odletech letadel. Data mohou obsahovat duplicity, které bude potřeba odstranit.

DataFrame departures_df je definován, ale zatím nad ním neproběhly žádné akce.

Toto cvičení je součástí kurzu

Cleaning Data with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Cachuj unikátní řádky z DataFrame departures_df.
  • Spusť dotaz s počítáním řádků nad departures_df a sleduj, jak dlouho operace trvá.
  • Spočítej řádky znovu a porovnej, jak se liší čas u cachovaného DataFrame.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

start_time = time.time()

# Add caching to the unique rows in departures_df
departures_df = departures_df.____.____

# Count the unique rows in departures_df, noting how long the operation takes
print("Counting %d rows took %f seconds" % (departures_df.____, time.time() - start_time))

# Count the rows again, noting the variance in time of a cached DataFrame
start_time = time.time()
print("Counting %d rows again took %f seconds" % (____, time.time() - start_time))
Upravit a spustit kód