Zapisywanie DataFrame w pamięci podręcznej
Masz do wykonania zadanie, które wymaga przeprowadzenia kilku operacji analitycznych na DataFrame. Wiesz już, że zapisywanie w pamięci podręcznej (ang. caching) może poprawić wydajność przy wielokrotnym korzystaniu z tego samego DataFrame – i chcesz to teraz zastosować.
Będziesz pracować z nowym zbiorem danych zawierającym informacje o odlotach samolotów. Dane mogą zawierać duplikaty, które trzeba będzie usunąć.
DataFrame departures_df jest już zdefiniowany, ale nie wykonano jeszcze żadnych operacji.
To ćwiczenie jest częścią kursu
Czyszczenie danych w PySpark
Instrukcje do ćwiczenia
- Zapisz w pamięci podręcznej unikalne wiersze z DataFrame
departures_df. - Wykonaj zapytanie zliczające wiersze w
departures_dfi zwróć uwagę na czas trwania operacji. - Policz wiersze ponownie i sprawdź, jak zmienił się czas wykonania dla DataFrame zapisanego w pamięci podręcznej.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
start_time = time.time()
# Add caching to the unique rows in departures_df
departures_df = departures_df.____.____
# Count the unique rows in departures_df, noting how long the operation takes
print("Counting %d rows took %f seconds" % (departures_df.____, time.time() - start_time))
# Count the rows again, noting the variance in time of a cached DataFrame
start_time = time.time()
print("Counting %d rows again took %f seconds" % (____, time.time() - start_time))