SQL і Parquet
Файли Parquet ідеально підходять як сховище даних для SQL‑запитів у Spark. Хоча ті самі запити можна виконувати безпосередньо через Python‑функції Spark, інколи простіше запускати SQL‑запити поряд із варіантами на Python.
У цьому прикладі ми зчитаємо файл Parquet, створений у попередній вправі, і зареєструємо його як SQL‑таблицю. Після реєстрації виконаємо короткий запит до цієї таблиці (тобто до файлу Parquet).
Об'єкт spark і файл AA_DFW_ALL.parquet уже доступні для вас автоматично.
Ця вправа є частиною курсу
Очищення даних у PySpark
Інструкції до вправи
- Імпортуйте файл
AA_DFW_ALL.parquetуflights_df. - Скористайтеся методом
createOrReplaceTempView, щоб надати псевдонім таблиціflights. - Запустіть запит Spark SQL до таблиці
flights.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Read the Parquet file into flights_df
flights_df = spark.read.____(____)
# Register the temp table
flights_df.____('flights')
# Run a SQL query of the average flight duration
avg_duration = spark.____('SELECT avg(flight_duration) from flights').collect()[0]
print('The average flight time is: %d' % avg_duration)