Are you query-ious?
Одна з переваг інтерфейсу DataFrame — можливість виконувати SQL-запити до таблиць у вашому кластері Spark. Якщо у вас немає досвіду з SQL — не хвилюйтеся, ми надамо готові запити! (Щоб дізнатися більше про SQL, почніть з курсу Introduction to SQL.)
Як ви бачили у попередній вправі, одна з таблиць у вашому кластері — це таблиця flights. Вона містить по одному рядку для кожного рейсу, що вилетів з аеропорту Портленда (PDX) або Сіетл-Такома (SEA) у 2014 та 2015 роках.
Виконати запит до цієї таблиці так само просто, як викликати метод .sql() у вашому SparkSession. Цей метод приймає рядок із запитом і повертає DataFrame з результатами!
Якщо придивитися, ви помітите, що таблиця flights згадується лише в тексті запиту, а не як аргумент будь-якого методу. Це тому, що у вашому середовищі немає локального об'єкта з цими даними, тож передавати таблицю як аргумент не має сенсу.
Пам'ятайте, у вашому робочому середовищі ми вже створили SparkSession під назвою spark. (Він більше не називається my_spark, адже ми створили його для вас!)
Ця вправа є частиною курсу
Основи PySpark
Інструкції до вправи
- Скористайтеся методом
.sql(), щоб отримати перші 10 рядків таблиціflights, і збережіть результат уflights10. Зміннаqueryмістить відповідний SQL-запит. - Використайте метод датафрейму
.show(), щоб вивестиflights10.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Don't change this query
query = "FROM flights SELECT * LIMIT 10"
# Get the first 10 rows of flights
flights10 = ____
# Show the results
flights10.____