НачатьНачать бесплатно

Отложенные вычисления на практике

Операции с отложенными вычислениями, как правило, выполняются примерно за одинаковое время вне зависимости от объёма данных. Это объясняется тем, что Spark не применяет никаких преобразований до тех пор, пока не будет запрошено действие.

В этом упражнении вы определите DataFrame (aa_dfw_df) и добавите несколько преобразований. Обратите внимание на время выполнения: сравните, сколько оно занимает при определении преобразований и при фактическом обращении к данным. Разница может быть небольшой, но заметной. При работе с полноценным кластером Spark на больших объёмах данных это различие будет значительно ощутимее.

Это упражнение является частью курса

Очистка данных с помощью PySpark

Посмотреть курс

Инструкции к упражнению

  • Загрузите DataFrame.
  • Добавьте преобразование F.lower() к столбцу Destination Airport.
  • Выведите DataFrame с помощью .show() и обратите внимание на время, которое занимает это действие.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Load the CSV file
aa_dfw_df = ____.____.____('csv').options(Header=True).load('AA_DFW_2018.csv.gz')

# Add the airport column using the F.lower() method
aa_dfw_df = aa_dfw_df.withColumn('airport', ____(aa_dfw_df['Destination Airport']))

# Show the DataFrame
____
Редактировать и запускать код