開始使用免費開始

把 Spark DataFrame 轉成 pandas

假設你已經在超大型資料集上執行查詢,並把結果彙總成較容易處理的規模。

有時候,把這張表拿到本機,改用 pandas 等工具處理會更方便。Spark 的 DataFrame 提供 .toPandas() 方法,能輕鬆做到這件事。對 Spark DataFrame 呼叫這個方法,就會回傳對應的 pandas DataFrame。就是這麼簡單!

這次的查詢會計算從 SEA 與 PDX 飛往各機場的航班數。

記住,你的工作環境中已經有名為 sparkSparkSession

本練習屬於課程

PySpark 基礎

檢視課程

練習說明

  • 使用 .sql() 方法執行查詢,將結果儲存到 flight_counts
  • flight_counts 上使用 .toPandas(),建立名為 pd_countspandas DataFrame。
  • 在主控台列印 pd_counts.head()

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Don't change this query
query = "SELECT origin, dest, COUNT(*) as N FROM flights GROUP BY origin, dest"

# Run the query
flight_counts = ____

# Convert the results to a pandas DataFrame
pd_counts = ____

# Print the head of pd_counts
print(____)
編輯並執行程式碼