Confrontare join broadcast vs join normali
Hai creato due tipi di join: normale e in broadcast. Ora la tua responsabile vuole sapere qual è il miglioramento delle prestazioni grazie alle ottimizzazioni di Spark. Se i risultati saranno promettenti, avrai l'opportunità di perfezionare la configurazione di Spark secondo necessità.
I tuoi DataFrame normal_df e broadcast_df sono a tua disposizione.
Questo esercizio fa parte del corso
Pulizia dei dati con PySpark
Istruzioni dell'esercizio
- Esegui
.count()sul DataFrame normale. - Esegui
.count()sul DataFrame in broadcast. - Stampa il conteggio e la durata dei DataFrame, annotando eventuali differenze.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
start_time = time.time()
# Count the number of rows in the normal DataFrame
normal_count = ____
normal_duration = time.time() - start_time
start_time = time.time()
# Count the number of rows in the broadcast DataFrame
broadcast_count = ____
broadcast_duration = time.time() - start_time
# Print the counts and the duration of the tests
print("Normal count:\t\t%d\tduration: %f" % (normal_count, normal_duration))
print("Broadcast count:\t%d\tduration: %f" % (broadcast_count, broadcast_duration))