ПочатиПочніть безкоштовно

SQL і Parquet

Файли Parquet ідеально підходять як сховище даних для SQL‑запитів у Spark. Хоча ті самі запити можна виконувати безпосередньо через Python‑функції Spark, інколи простіше запускати SQL‑запити поряд із варіантами на Python.

У цьому прикладі ми зчитаємо файл Parquet, створений у попередній вправі, і зареєструємо його як SQL‑таблицю. Після реєстрації виконаємо короткий запит до цієї таблиці (тобто до файлу Parquet).

Об'єкт spark і файл AA_DFW_ALL.parquet уже доступні для вас автоматично.

Ця вправа є частиною курсу

Очищення даних у PySpark

Переглянути курс

Інструкції до вправи

  • Імпортуйте файл AA_DFW_ALL.parquet у flights_df.
  • Скористайтеся методом createOrReplaceTempView, щоб надати псевдонім таблиці flights.
  • Запустіть запит Spark SQL до таблиці flights.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Read the Parquet file into flights_df
flights_df = spark.read.____(____)

# Register the temp table
flights_df.____('flights')

# Run a SQL query of the average flight duration
avg_duration = spark.____('SELECT avg(flight_duration) from flights').collect()[0]
print('The average flight time is: %d' % avg_duration)
Редагувати та запускати код