Inizia subitoInizia gratis

Confrontare join broadcast vs join normali

Hai creato due tipi di join: normale e in broadcast. Ora la tua responsabile vuole sapere qual è il miglioramento delle prestazioni grazie alle ottimizzazioni di Spark. Se i risultati saranno promettenti, avrai l'opportunità di perfezionare la configurazione di Spark secondo necessità.

I tuoi DataFrame normal_df e broadcast_df sono a tua disposizione.

Questo esercizio fa parte del corso

Pulizia dei dati con PySpark

Visualizza corso

Istruzioni dell'esercizio

  • Esegui .count() sul DataFrame normale.
  • Esegui .count() sul DataFrame in broadcast.
  • Stampa il conteggio e la durata dei DataFrame, annotando eventuali differenze.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

start_time = time.time()
# Count the number of rows in the normal DataFrame
normal_count = ____
normal_duration = time.time() - start_time

start_time = time.time()
# Count the number of rows in the broadcast DataFrame
broadcast_count = ____
broadcast_duration = time.time() - start_time

# Print the counts and the duration of the tests
print("Normal count:\t\t%d\tduration: %f" % (normal_count, normal_duration))
print("Broadcast count:\t%d\tduration: %f" % (broadcast_count, broadcast_duration))
Modifica ed esegui il codice