Швидкий конвеєр
Перш ніж розбирати складніші дані, ваш(а) керівник(ця) хоче побачити простий приклад конвеєра з базовими кроками. У цьому прикладі потрібно завантажити файл даних, відфільтрувати кілька рядків, додати до нього стовпець з ідентифікатором, а потім записати результат як дані JSON.
Контекст spark уже визначений, а бібліотеку pyspark.sql.functions прийнято скорочувати як F.
Ця вправа є частиною курсу
Очищення даних у PySpark
Інструкції до вправи
- Імпортуйте файл
2015-departures.csv.gzу DataFrame. Зверніть увагу: заголовок уже заданий. - Відфільтруйте DataFrame, щоб залишити лише рейси з тривалістю понад 0 хвилин. Використовуйте індекс стовпця, а не його назву (пам'ятайте про
.printSchema(), щоб побачити назви стовпців і їхній порядок). - Додайте стовпець з ідентифікатором (ID).
- Запишіть файл як документ JSON з назвою
output.json.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import the data to a DataFrame
departures_df = spark.____(____, header=____)
# Remove any duration of 0
departures_df = departures_df.____(____)
# Add an ID column
departures_df = departures_df.____('id', ____)
# Write the file out to JSON format
____.write.____(____, mode='overwrite')