Порівняння з'єднань: broadcast проти звичайного
Ви створили два типи з'єднань: звичайне та розповсюджуване (broadcast). Тепер ваш керівник хоче дізнатися, який виграш у продуктивності дає використання оптимізацій Spark. Якщо результати будуть обнадійливими, ви отримаєте більше можливостей налаштовувати Spark за потреби.
Ваші датафрейми normal_df і broadcast_df доступні для використання.
Ця вправа є частиною курсу
Очищення даних у PySpark
Інструкції до вправи
- Виконайте
.count()для звичайного датафрейму. - Виконайте
.count()для розповсюджуваного (broadcast) датафрейму. - Виведіть кількість рядків і тривалість для обох датафреймів, відмітьте будь-які відмінності.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
start_time = time.time()
# Count the number of rows in the normal DataFrame
normal_count = ____
normal_duration = time.time() - start_time
start_time = time.time()
# Count the number of rows in the broadcast DataFrame
broadcast_count = ____
broadcast_duration = time.time() - start_time
# Print the counts and the duration of the tests
print("Normal count:\t\t%d\tduration: %f" % (normal_count, normal_duration))
print("Broadcast count:\t%d\tduration: %f" % (broadcast_count, broadcast_duration))