把 Spark DataFrame 轉成 pandas
假設你已經在超大型資料集上執行查詢,並把結果彙總成較容易處理的規模。
有時候,把這張表拿到本機,改用 pandas 等工具處理會更方便。Spark 的 DataFrame 提供 .toPandas() 方法,能輕鬆做到這件事。對 Spark DataFrame 呼叫這個方法,就會回傳對應的 pandas DataFrame。就是這麼簡單!
這次的查詢會計算從 SEA 與 PDX 飛往各機場的航班數。
記住,你的工作環境中已經有名為 spark 的 SparkSession!
本練習屬於課程
PySpark 基礎
練習說明
- 使用
.sql()方法執行查詢,將結果儲存到flight_counts。 - 在
flight_counts上使用.toPandas(),建立名為pd_counts的pandasDataFrame。 - 在主控台列印
pd_counts的.head()。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Don't change this query
query = "SELECT origin, dest, COUNT(*) as N FROM flights GROUP BY origin, dest"
# Run the query
flight_counts = ____
# Convert the results to a pandas DataFrame
pd_counts = ____
# Print the head of pd_counts
print(____)