ПочатиПочніть безкоштовно

Налаштування конфігурацій Spark

Тепер, коли ви переглянули деякі конфігурації Spark на вашому кластері, ви хочете змінити кілька параметрів, щоб налаштувати Spark під свої потреби. Ви імпортуєте дані, щоб перевірити, що ваші зміни вплинули на кластер.

Початкова конфігурація Spark встановлена на значення за замовчуванням — 200 розділів.

Обʼєкт spark доступний для використання. Файл departures.txt.gz доступний для імпорту. Початковий DataFrame, що містить унікальні рядки з departures.txt.gz, доступний як departures_df.

Ця вправа є частиною курсу

Очищення даних у PySpark

Переглянути курс

Інструкції до вправи

  • Збережіть кількість розділів у departures_df у змінній before.
  • Змініть конфігурацію spark.sql.shuffle.partitions на 500 розділів.
  • Створіть заново DataFrame departures_df, прочитавши унікальні рядки з файлу departures.
  • Виведіть кількість розділів до та після зміни конфігурації.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Store the number of partitions in variable
before = departures_df.____

# Configure Spark to use 500 partitions
____('spark.sql.shuffle.partitions', ____)

# Recreate the DataFrame using the departures data file
departures_df = spark.read.csv('departures.txt.gz').____

# Print the number of partitions for each instance
print("Partition count before change: %d" % ____)
print("Partition count after change: %d" % ____)
Редагувати та запускати код