Jämföra broadcast- och normala joins
Du har skapat två typer av joins: normala och broadcastade. Nu vill din chef veta hur mycket prestandan förbättras med Sparks optimeringar. Om resultaten är lovande får du möjlighet att finjustera Spark-konfigurationen ytterligare.
Dina DataFrames normal_df och broadcast_df finns tillgängliga för dig.
Den här övningen är en del av kursen
Datarensning med PySpark
Övningsinstruktioner
- Kör
.count()på den normala DataFrame:en. - Kör
.count()på den broadcastade DataFrame:en. - Skriv ut antalet rader och körtiden för respektive DataFrame och notera eventuella skillnader.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
start_time = time.time()
# Count the number of rows in the normal DataFrame
normal_count = ____
normal_duration = time.time() - start_time
start_time = time.time()
# Count the number of rows in the broadcast DataFrame
broadcast_count = ____
broadcast_duration = time.time() - start_time
# Print the counts and the duration of the tests
print("Normal count:\t\t%d\tduration: %f" % (normal_count, normal_duration))
print("Broadcast count:\t%d\tduration: %f" % (broadcast_count, broadcast_duration))