Преобразование Spark DataFrame в pandas
Предположим, вы выполнили запрос к большому набору данных и агрегировали его до более компактного результата.
Иногда удобно взять эту таблицу и работать с ней локально — например, с помощью pandas. Spark DataFrame делает это простым: метод .toPandas() преобразует Spark DataFrame в соответствующий pandas DataFrame. Всё именно так просто!
В этом упражнении запрос подсчитывает количество рейсов из SEA и PDX в каждый аэропорт.
Напомним: в вашем рабочем пространстве уже создан объект SparkSession с именем spark!
Это упражнение является частью курса
Основы PySpark
Инструкции к упражнению
- Выполните запрос с помощью метода
.sql(). Сохраните результат в переменнуюflight_counts. - Примените метод
.toPandas()кflight_counts, чтобы создатьpandasDataFrame с именемpd_counts. - Выведите в консоль результат метода
.head()объектаpd_counts.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Don't change this query
query = "SELECT origin, dest, COUNT(*) as N FROM flights GROUP BY origin, dest"
# Run the query
flight_counts = ____
# Convert the results to a pandas DataFrame
pd_counts = ____
# Print the head of pd_counts
print(____)