SQL и Parquet
Файлы Parquet отлично подходят в качестве хранилища данных для SQL-запросов в Spark. Хотя те же запросы можно выполнять напрямую с помощью Python-функций Spark, иногда удобнее использовать SQL-запросы наряду с Python.
В этом упражнении вы загрузите файл Parquet, созданный в предыдущем задании, и зарегистрируете его как SQL-таблицу. После регистрации выполните быстрый запрос к этой таблице (то есть к файлу Parquet).
Объект spark и файл AA_DFW_ALL.parquet уже доступны вам автоматически.
Это упражнение является частью курса
Очистка данных с помощью PySpark
Инструкции к упражнению
- Загрузите файл
AA_DFW_ALL.parquetв переменнуюflights_df. - Используйте метод
createOrReplaceTempView, чтобы зарегистрировать таблицу с именемflights. - Выполните SQL-запрос Spark к таблице
flights.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Read the Parquet file into flights_df
flights_df = spark.read.____(____)
# Register the temp table
flights_df.____('flights')
# Run a SQL query of the average flight duration
avg_duration = spark.____('SELECT avg(flight_duration) from flights').collect()[0]
print('The average flight time is: %d' % avg_duration)