НачатьНачать бесплатно

Быстрый конвейер

Прежде чем перейти к обработке более сложных данных, ваш менеджер хотел бы увидеть простой пример конвейера с основными шагами. В этом упражнении нужно загрузить файл с данными, отфильтровать несколько строк, добавить столбец с идентификаторами, а затем сохранить результат в формате JSON.

Контекст spark уже определён, а библиотека pyspark.sql.functions импортирована с псевдонимом F в соответствии с общепринятым соглашением.

Это упражнение является частью курса

Очистка данных с помощью PySpark

Посмотреть курс

Инструкции к упражнению

  • Загрузите файл 2015-departures.csv.gz в DataFrame. Обратите внимание, что заголовок уже задан.
  • Отфильтруйте DataFrame так, чтобы он содержал только рейсы с продолжительностью более 0 минут. Используйте индекс столбца, а не его название (воспользуйтесь .printSchema(), чтобы увидеть названия и порядок столбцов).
  • Добавьте столбец с идентификаторами.
  • Сохраните результат как JSON-документ с именем output.json.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import the data to a DataFrame
departures_df = spark.____(____, header=____)

# Remove any duration of 0
departures_df = departures_df.____(____)

# Add an ID column
departures_df = departures_df.____('id', ____)

# Write the file out to JSON format
____.write.____(____, mode='overwrite')
Редактировать и запускать код