НачатьНачать бесплатно

Преобразование Spark DataFrame в pandas

Предположим, вы выполнили запрос к большому набору данных и агрегировали его до более компактного результата.

Иногда удобно взять эту таблицу и работать с ней локально — например, с помощью pandas. Spark DataFrame делает это простым: метод .toPandas() преобразует Spark DataFrame в соответствующий pandas DataFrame. Всё именно так просто!

В этом упражнении запрос подсчитывает количество рейсов из SEA и PDX в каждый аэропорт.

Напомним: в вашем рабочем пространстве уже создан объект SparkSession с именем spark!

Это упражнение является частью курса

Основы PySpark

Посмотреть курс

Инструкции к упражнению

  • Выполните запрос с помощью метода .sql(). Сохраните результат в переменную flight_counts.
  • Примените метод .toPandas() к flight_counts, чтобы создать pandas DataFrame с именем pd_counts.
  • Выведите в консоль результат метода .head() объекта pd_counts.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Don't change this query
query = "SELECT origin, dest, COUNT(*) as N FROM flights GROUP BY origin, dest"

# Run the query
flight_counts = ____

# Convert the results to a pandas DataFrame
pd_counts = ____

# Print the head of pd_counts
print(____)
Редактировать и запускать код