ПочатиПочніть безкоштовно

Швидкий конвеєр

Перш ніж розбирати складніші дані, ваш(а) керівник(ця) хоче побачити простий приклад конвеєра з базовими кроками. У цьому прикладі потрібно завантажити файл даних, відфільтрувати кілька рядків, додати до нього стовпець з ідентифікатором, а потім записати результат як дані JSON.

Контекст spark уже визначений, а бібліотеку pyspark.sql.functions прийнято скорочувати як F.

Ця вправа є частиною курсу

Очищення даних у PySpark

Переглянути курс

Інструкції до вправи

  • Імпортуйте файл 2015-departures.csv.gz у DataFrame. Зверніть увагу: заголовок уже заданий.
  • Відфільтруйте DataFrame, щоб залишити лише рейси з тривалістю понад 0 хвилин. Використовуйте індекс стовпця, а не його назву (пам'ятайте про .printSchema(), щоб побачити назви стовпців і їхній порядок).
  • Додайте стовпець з ідентифікатором (ID).
  • Запишіть файл як документ JSON з назвою output.json.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import the data to a DataFrame
departures_df = spark.____(____, header=____)

# Remove any duration of 0
departures_df = departures_df.____(____)

# Add an ID column
departures_df = departures_df.____('id', ____)

# Write the file out to JSON format
____.write.____(____, mode='overwrite')
Редагувати та запускати код