ПочатиПочніть безкоштовно

Are you query-ious?

Одна з переваг інтерфейсу DataFrame — можливість виконувати SQL-запити до таблиць у вашому кластері Spark. Якщо у вас немає досвіду з SQL — не хвилюйтеся, ми надамо готові запити! (Щоб дізнатися більше про SQL, почніть з курсу Introduction to SQL.)

Як ви бачили у попередній вправі, одна з таблиць у вашому кластері — це таблиця flights. Вона містить по одному рядку для кожного рейсу, що вилетів з аеропорту Портленда (PDX) або Сіетл-Такома (SEA) у 2014 та 2015 роках.

Виконати запит до цієї таблиці так само просто, як викликати метод .sql() у вашому SparkSession. Цей метод приймає рядок із запитом і повертає DataFrame з результатами!

Якщо придивитися, ви помітите, що таблиця flights згадується лише в тексті запиту, а не як аргумент будь-якого методу. Це тому, що у вашому середовищі немає локального об'єкта з цими даними, тож передавати таблицю як аргумент не має сенсу.

Пам'ятайте, у вашому робочому середовищі ми вже створили SparkSession під назвою spark. (Він більше не називається my_spark, адже ми створили його для вас!)

Ця вправа є частиною курсу

Основи PySpark

Переглянути курс

Інструкції до вправи

  • Скористайтеся методом .sql(), щоб отримати перші 10 рядків таблиці flights, і збережіть результат у flights10. Змінна query містить відповідний SQL-запит.
  • Використайте метод датафрейму .show(), щоб вивести flights10.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Don't change this query
query = "FROM flights SELECT * LIMIT 10"

# Get the first 10 rows of flights
flights10 = ____

# Show the results
flights10.____
Редагувати та запускати код