Zacznij terazZacznij za darmo

Zapisywanie DataFrame w pamięci podręcznej

Masz do wykonania zadanie, które wymaga przeprowadzenia kilku operacji analitycznych na DataFrame. Wiesz już, że zapisywanie w pamięci podręcznej (ang. caching) może poprawić wydajność przy wielokrotnym korzystaniu z tego samego DataFrame – i chcesz to teraz zastosować.

Będziesz pracować z nowym zbiorem danych zawierającym informacje o odlotach samolotów. Dane mogą zawierać duplikaty, które trzeba będzie usunąć.

DataFrame departures_df jest już zdefiniowany, ale nie wykonano jeszcze żadnych operacji.

To ćwiczenie jest częścią kursu

Czyszczenie danych w PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Zapisz w pamięci podręcznej unikalne wiersze z DataFrame departures_df.
  • Wykonaj zapytanie zliczające wiersze w departures_df i zwróć uwagę na czas trwania operacji.
  • Policz wiersze ponownie i sprawdź, jak zmienił się czas wykonania dla DataFrame zapisanego w pamięci podręcznej.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

start_time = time.time()

# Add caching to the unique rows in departures_df
departures_df = departures_df.____.____

# Count the unique rows in departures_df, noting how long the operation takes
print("Counting %d rows took %f seconds" % (departures_df.____, time.time() - start_time))

# Count the rows again, noting the variance in time of a cached DataFrame
start_time = time.time()
print("Counting %d rows again took %f seconds" % (____, time.time() - start_time))
Edytuj i uruchom kod