Compararea join-urilor broadcast față de cele normale
Ai creat două tipuri de join-uri: normal și broadcast. Acum managerul tău vrea să știe care este îmbunătățirea de performanță obținută prin optimizările Spark. Dacă rezultatele sunt promițătoare, vei avea ocazia să ajustezi configurația Spark după cum este necesar.
DataFrame-urile normal_df și broadcast_df sunt disponibile pentru a fi utilizate.
Acest exercițiu face parte din cursul
Curățarea datelor cu PySpark
Instrucțiuni pentru exercițiu
- Execută
.count()pe DataFrame-ul normal. - Execută
.count()pe DataFrame-ul broadcast. - Afișează numărul de înregistrări și durata pentru fiecare DataFrame, observând diferențele.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
start_time = time.time()
# Count the number of rows in the normal DataFrame
normal_count = ____
normal_duration = time.time() - start_time
start_time = time.time()
# Count the number of rows in the broadcast DataFrame
broadcast_count = ____
broadcast_duration = time.time() - start_time
# Print the counts and the duration of the tests
print("Normal count:\t\t%d\tduration: %f" % (normal_count, normal_duration))
print("Broadcast count:\t%d\tduration: %f" % (broadcast_count, broadcast_duration))