ПочатиПочніть безкоштовно

Порівняння з'єднань: broadcast проти звичайного

Ви створили два типи з'єднань: звичайне та розповсюджуване (broadcast). Тепер ваш керівник хоче дізнатися, який виграш у продуктивності дає використання оптимізацій Spark. Якщо результати будуть обнадійливими, ви отримаєте більше можливостей налаштовувати Spark за потреби.

Ваші датафрейми normal_df і broadcast_df доступні для використання.

Ця вправа є частиною курсу

Очищення даних у PySpark

Переглянути курс

Інструкції до вправи

  • Виконайте .count() для звичайного датафрейму.
  • Виконайте .count() для розповсюджуваного (broadcast) датафрейму.
  • Виведіть кількість рядків і тривалість для обох датафреймів, відмітьте будь-які відмінності.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

start_time = time.time()
# Count the number of rows in the normal DataFrame
normal_count = ____
normal_duration = time.time() - start_time

start_time = time.time()
# Count the number of rows in the broadcast DataFrame
broadcast_count = ____
broadcast_duration = time.time() - start_time

# Print the counts and the duration of the tests
print("Normal count:\t\t%d\tduration: %f" % (normal_count, normal_duration))
print("Broadcast count:\t%d\tduration: %f" % (broadcast_count, broadcast_duration))
Редагувати та запускати код