Любопытны к запросам?
Одно из преимуществ интерфейса DataFrame — возможность выполнять SQL-запросы к таблицам в вашем кластере Spark. Если у вас нет опыта работы с SQL, не беспокойтесь: мы будем предоставлять вам готовые запросы! (Чтобы подробнее изучить SQL, пройдите наш курс Введение в SQL.)
Как вы видели в предыдущем упражнении, одна из таблиц в вашем кластере — это таблица flights. Она содержит по одной строке для каждого рейса, вылетевшего из международного аэропорта Портленда (PDX) или международного аэропорта Сиэтл-Такома (SEA) в 2014 и 2015 годах.
Выполнить запрос к этой таблице очень просто — достаточно вызвать метод .sql() на объекте SparkSession. Метод принимает строку с запросом и возвращает DataFrame с результатами!
Если присмотреться, можно заметить, что таблица flights упоминается только в самом запросе, а не передаётся как аргумент какого-либо метода. Это связано с тем, что в вашей среде нет локального объекта, хранящего эти данные, — поэтому передавать таблицу в качестве аргумента не имеет смысла.
Напомним: объект SparkSession с именем spark уже создан в вашем рабочем пространстве. (Теперь он называется не my_spark, а spark — мы создали его за вас!)
Это упражнение является частью курса
Основы PySpark
Инструкции к упражнению
- Используйте метод
.sql(), чтобы получить первые 10 строк таблицыflights, и сохраните результат в переменнуюflights10. Переменнаяqueryсодержит нужный SQL-запрос. - Используйте метод DataFrame
.show(), чтобы вывестиflights10на экран.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Don't change this query
query = "FROM flights SELECT * LIMIT 10"
# Get the first 10 rows of flights
flights10 = ____
# Show the results
flights10.____