Porównanie złączeń broadcast i zwykłych
Masz już dwa rodzaje złączeń: zwykłe i z rozgłaszaniem (broadcast). Teraz twój menedżer chce wiedzieć, jaką poprawę wydajności dają optymalizacje Sparka. Jeśli wyniki okażą się obiecujące, dostaniesz więcej możliwości dostosowania konfiguracji Sparka.
Do dyspozycji masz DataFrames normal_df i broadcast_df.
To ćwiczenie jest częścią kursu
Czyszczenie danych w PySpark
Instrukcje do ćwiczenia
- Wywołaj
.count()na zwykłym DataFrame. - Wywołaj
.count()na rozgłoszonym DataFrame. - Wypisz liczbę wierszy i czas wykonania obu DataFrame, zwracając uwagę na różnice.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
start_time = time.time()
# Count the number of rows in the normal DataFrame
normal_count = ____
normal_duration = time.time() - start_time
start_time = time.time()
# Count the number of rows in the broadcast DataFrame
broadcast_count = ____
broadcast_duration = time.time() - start_time
# Print the counts and the duration of the tests
print("Normal count:\t\t%d\tduration: %f" % (normal_count, normal_duration))
print("Broadcast count:\t%d\tduration: %f" % (broadcast_count, broadcast_duration))