НачатьНачать бесплатно

SQL и Parquet

Файлы Parquet отлично подходят в качестве хранилища данных для SQL-запросов в Spark. Хотя те же запросы можно выполнять напрямую с помощью Python-функций Spark, иногда удобнее использовать SQL-запросы наряду с Python.

В этом упражнении вы загрузите файл Parquet, созданный в предыдущем задании, и зарегистрируете его как SQL-таблицу. После регистрации выполните быстрый запрос к этой таблице (то есть к файлу Parquet).

Объект spark и файл AA_DFW_ALL.parquet уже доступны вам автоматически.

Это упражнение является частью курса

Очистка данных с помощью PySpark

Посмотреть курс

Инструкции к упражнению

  • Загрузите файл AA_DFW_ALL.parquet в переменную flights_df.
  • Используйте метод createOrReplaceTempView, чтобы зарегистрировать таблицу с именем flights.
  • Выполните SQL-запрос Spark к таблице flights.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Read the Parquet file into flights_df
flights_df = spark.read.____(____)

# Register the temp table
flights_df.____('flights')

# Run a SQL query of the average flight duration
avg_duration = spark.____('SELECT avg(flight_duration) from flights').collect()[0]
print('The average flight time is: %d' % avg_duration)
Редактировать и запускать код