Porovnání broadcast joinu a běžného joinu
Vytvořil/a jsi dva typy joinů – běžný a broadcastovaný. Tvůj manažer teď chce vědět, jaké zlepšení výkonu přináší Sparkové optimalizace. Pokud budou výsledky slibné, dostaneš příležitost dále upravit nastavení Sparku podle potřeby.
K dispozici máš DataFramy normal_df a broadcast_df.
Toto cvičení je součástí kurzu
Cleaning Data with PySpark
Pokyny k cvičení
- Spusť
.count()na běžném DataFramu. - Spusť
.count()na broadcastovaném DataFramu. - Vypiš počet záznamů a dobu trvání obou DataFramů a všimni si případných rozdílů.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
start_time = time.time()
# Count the number of rows in the normal DataFrame
normal_count = ____
normal_duration = time.time() - start_time
start_time = time.time()
# Count the number of rows in the broadcast DataFrame
broadcast_count = ____
broadcast_duration = time.time() - start_time
# Print the counts and the duration of the tests
print("Normal count:\t\t%d\tduration: %f" % (normal_count, normal_duration))
print("Broadcast count:\t%d\tduration: %f" % (broadcast_count, broadcast_duration))