Сравнение широковещательного и обычного соединений
Вы создали два типа соединений: обычное и широковещательное. Теперь ваш руководитель хочет узнать, насколько оптимизации Spark улучшают производительность. Если результаты окажутся впечатляющими, вам предоставят больше возможностей для настройки конфигурации Spark.
Для выполнения задания вам доступны DataFrame-ы normal_df и broadcast_df.
Это упражнение является частью курса
Очистка данных с помощью PySpark
Инструкции к упражнению
- Выполните
.count()для обычного DataFrame. - Выполните
.count()для широковещательного DataFrame. - Выведите количество строк и время выполнения для каждого DataFrame, обратив внимание на различия.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
start_time = time.time()
# Count the number of rows in the normal DataFrame
normal_count = ____
normal_duration = time.time() - start_time
start_time = time.time()
# Count the number of rows in the broadcast DataFrame
broadcast_count = ____
broadcast_duration = time.time() - start_time
# Print the counts and the duration of the tests
print("Normal count:\t\t%d\tduration: %f" % (normal_count, normal_duration))
print("Broadcast count:\t%d\tduration: %f" % (broadcast_count, broadcast_duration))