НачатьНачать бесплатно

Сравнение широковещательного и обычного соединений

Вы создали два типа соединений: обычное и широковещательное. Теперь ваш руководитель хочет узнать, насколько оптимизации Spark улучшают производительность. Если результаты окажутся впечатляющими, вам предоставят больше возможностей для настройки конфигурации Spark.

Для выполнения задания вам доступны DataFrame-ы normal_df и broadcast_df.

Это упражнение является частью курса

Очистка данных с помощью PySpark

Посмотреть курс

Инструкции к упражнению

  • Выполните .count() для обычного DataFrame.
  • Выполните .count() для широковещательного DataFrame.
  • Выведите количество строк и время выполнения для каждого DataFrame, обратив внимание на различия.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

start_time = time.time()
# Count the number of rows in the normal DataFrame
normal_count = ____
normal_duration = time.time() - start_time

start_time = time.time()
# Count the number of rows in the broadcast DataFrame
broadcast_count = ____
broadcast_duration = time.time() - start_time

# Print the counts and the duration of the tests
print("Normal count:\t\t%d\tduration: %f" % (normal_count, normal_duration))
print("Broadcast count:\t%d\tduration: %f" % (broadcast_count, broadcast_duration))
Редактировать и запускать код