ПочатиПочніть безкоштовно

Перетворення Spark DataFrame на pandas DataFrame

Припустімо, ви виконали запит на своєму величезному наборі даних і згорнули його до чогось більш керованого.

Інколи доцільно взяти таку таблицю й попрацювати з нею локально, наприклад у pandas. З DataFrame у Spark це просто завдяки методу .toPandas(). Виклик цього методу для Spark DataFrame повертає відповідний pandas DataFrame. Справді все так просто!

Цього разу запит рахує кількість рейсів до кожного аеропорту з SEA та PDX.

Пам'ятайте, у вашому робочому середовищі вже є SparkSession під назвою spark!

Ця вправа є частиною курсу

Основи PySpark

Переглянути курс

Інструкції до вправи

  • Запустіть запит за допомогою методу .sql(). Збережіть результат у flight_counts.
  • Використайте метод .toPandas() для flight_counts, щоб створити pandas DataFrame з назвою pd_counts.
  • Виведіть у консоль результат .head() для pd_counts.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Don't change this query
query = "SELECT origin, dest, COUNT(*) as N FROM flights GROUP BY origin, dest"

# Run the query
flight_counts = ____

# Convert the results to a pandas DataFrame
pd_counts = ____

# Print the head of pd_counts
print(____)
Редагувати та запускати код