Zacznij terazZacznij za darmo

Porównanie złączeń broadcast i zwykłych

Masz już dwa rodzaje złączeń: zwykłe i z rozgłaszaniem (broadcast). Teraz twój menedżer chce wiedzieć, jaką poprawę wydajności dają optymalizacje Sparka. Jeśli wyniki okażą się obiecujące, dostaniesz więcej możliwości dostosowania konfiguracji Sparka.

Do dyspozycji masz DataFrames normal_df i broadcast_df.

To ćwiczenie jest częścią kursu

Czyszczenie danych w PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Wywołaj .count() na zwykłym DataFrame.
  • Wywołaj .count() na rozgłoszonym DataFrame.
  • Wypisz liczbę wierszy i czas wykonania obu DataFrame, zwracając uwagę na różnice.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

start_time = time.time()
# Count the number of rows in the normal DataFrame
normal_count = ____
normal_duration = time.time() - start_time

start_time = time.time()
# Count the number of rows in the broadcast DataFrame
broadcast_count = ____
broadcast_duration = time.time() - start_time

# Print the counts and the duration of the tests
print("Normal count:\t\t%d\tduration: %f" % (normal_count, normal_duration))
print("Broadcast count:\t%d\tduration: %f" % (broadcast_count, broadcast_duration))
Edytuj i uruchom kod