Настройка конфигурации Spark
Изучив конфигурацию Spark на вашем кластере, вы хотите изменить некоторые параметры, чтобы настроить Spark под свои задачи. Загрузите данные и убедитесь, что изменения вступили в силу.
Начальное значение конфигурации Spark — 200 разделов (партиций).
Объект spark доступен для использования. Для импорта доступен файл departures.txt.gz. Исходный DataFrame с уникальными строками из departures.txt.gz доступен как departures_df.
Это упражнение является частью курса
Очистка данных с помощью PySpark
Инструкции к упражнению
- Сохраните количество разделов в
departures_dfв переменнуюbefore. - Измените параметр конфигурации
spark.sql.shuffle.partitionsна 500 разделов. - Пересоздайте DataFrame
departures_df, считав уникальные строки из файла с данными о рейсах. - Выведите количество разделов до и после изменения конфигурации.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Store the number of partitions in variable
before = departures_df.____
# Configure Spark to use 500 partitions
____('spark.sql.shuffle.partitions', ____)
# Recreate the DataFrame using the departures data file
departures_df = spark.read.csv('departures.txt.gz').____
# Print the number of partitions for each instance
print("Partition count before change: %d" % ____)
print("Partition count after change: %d" % ____)