Cachování DataFrame
Dostal/a jsi za úkol provést několik analytických operací nad DataFrame. Víš už, že cachování může zlepšit výkon při opakovaném používání DataFramů, a chceš ho teď využít v praxi.
Budeš pracovat s novým datasetem obsahujícím informace o odletech letadel. Data mohou obsahovat duplicity, které bude potřeba odstranit.
DataFrame departures_df je definován, ale zatím nad ním neproběhly žádné akce.
Toto cvičení je součástí kurzu
Cleaning Data with PySpark
Pokyny k cvičení
- Cachuj unikátní řádky z DataFrame
departures_df. - Spusť dotaz s počítáním řádků nad
departures_dfa sleduj, jak dlouho operace trvá. - Spočítej řádky znovu a porovnej, jak se liší čas u cachovaného DataFrame.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
start_time = time.time()
# Add caching to the unique rows in departures_df
departures_df = departures_df.____.____
# Count the unique rows in departures_df, noting how long the operation takes
print("Counting %d rows took %f seconds" % (departures_df.____, time.time() - start_time))
# Count the rows again, noting the variance in time of a cached DataFrame
start_time = time.time()
print("Counting %d rows again took %f seconds" % (____, time.time() - start_time))