Перетворення Spark DataFrame на pandas DataFrame
Припустімо, ви виконали запит на своєму величезному наборі даних і згорнули його до чогось більш керованого.
Інколи доцільно взяти таку таблицю й попрацювати з нею локально, наприклад у pandas. З DataFrame у Spark це просто завдяки методу .toPandas(). Виклик цього методу для Spark DataFrame повертає відповідний pandas DataFrame. Справді все так просто!
Цього разу запит рахує кількість рейсів до кожного аеропорту з SEA та PDX.
Пам'ятайте, у вашому робочому середовищі вже є SparkSession під назвою spark!
Ця вправа є частиною курсу
Основи PySpark
Інструкції до вправи
- Запустіть запит за допомогою методу
.sql(). Збережіть результат уflight_counts. - Використайте метод
.toPandas()дляflight_counts, щоб створитиpandasDataFrame з назвоюpd_counts. - Виведіть у консоль результат
.head()дляpd_counts.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Don't change this query
query = "SELECT origin, dest, COUNT(*) as N FROM flights GROUP BY origin, dest"
# Run the query
flight_counts = ____
# Convert the results to a pandas DataFrame
pd_counts = ____
# Print the head of pd_counts
print(____)