Быстрый конвейер
Прежде чем перейти к обработке более сложных данных, ваш менеджер хотел бы увидеть простой пример конвейера с основными шагами. В этом упражнении нужно загрузить файл с данными, отфильтровать несколько строк, добавить столбец с идентификаторами, а затем сохранить результат в формате JSON.
Контекст spark уже определён, а библиотека pyspark.sql.functions импортирована с псевдонимом F в соответствии с общепринятым соглашением.
Это упражнение является частью курса
Очистка данных с помощью PySpark
Инструкции к упражнению
- Загрузите файл
2015-departures.csv.gzв DataFrame. Обратите внимание, что заголовок уже задан. - Отфильтруйте DataFrame так, чтобы он содержал только рейсы с продолжительностью более 0 минут. Используйте индекс столбца, а не его название (воспользуйтесь
.printSchema(), чтобы увидеть названия и порядок столбцов). - Добавьте столбец с идентификаторами.
- Сохраните результат как JSON-документ с именем
output.json.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import the data to a DataFrame
departures_df = spark.____(____, header=____)
# Remove any duration of 0
departures_df = departures_df.____(____)
# Add an ID column
departures_df = departures_df.____('id', ____)
# Write the file out to JSON format
____.write.____(____, mode='overwrite')