НачатьНачать бесплатно

Настройка конфигурации Spark

Изучив конфигурацию Spark на вашем кластере, вы хотите изменить некоторые параметры, чтобы настроить Spark под свои задачи. Загрузите данные и убедитесь, что изменения вступили в силу.

Начальное значение конфигурации Spark — 200 разделов (партиций).

Объект spark доступен для использования. Для импорта доступен файл departures.txt.gz. Исходный DataFrame с уникальными строками из departures.txt.gz доступен как departures_df.

Это упражнение является частью курса

Очистка данных с помощью PySpark

Посмотреть курс

Инструкции к упражнению

  • Сохраните количество разделов в departures_df в переменную before.
  • Измените параметр конфигурации spark.sql.shuffle.partitions на 500 разделов.
  • Пересоздайте DataFrame departures_df, считав уникальные строки из файла с данными о рейсах.
  • Выведите количество разделов до и после изменения конфигурации.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Store the number of partitions in variable
before = departures_df.____

# Configure Spark to use 500 partitions
____('spark.sql.shuffle.partitions', ____)

# Recreate the DataFrame using the departures data file
departures_df = spark.read.csv('departures.txt.gz').____

# Print the number of partitions for each instance
print("Partition count before change: %d" % ____)
print("Partition count after change: %d" % ____)
Редактировать и запускать код