1. Learn
  2. /
  3. Курси
  4. /
  5. Очищення даних у PySpark

Connected

Вправа

SQL і Parquet

Файли Parquet ідеально підходять як сховище даних для SQL‑запитів у Spark. Хоча ті самі запити можна виконувати безпосередньо через Python‑функції Spark, інколи простіше запускати SQL‑запити поряд із варіантами на Python.

У цьому прикладі ми зчитаємо файл Parquet, створений у попередній вправі, і зареєструємо його як SQL‑таблицю. Після реєстрації виконаємо короткий запит до цієї таблиці (тобто до файлу Parquet).

Об'єкт spark і файл AA_DFW_ALL.parquet уже доступні для вас автоматично.

Інструкції

100 XP
  • Імпортуйте файл AA_DFW_ALL.parquet у flights_df.
  • Скористайтеся методом createOrReplaceTempView, щоб надати псевдонім таблиці flights.
  • Запустіть запит Spark SQL до таблиці flights.