開始使用免費開始

Joining II

在 PySpark 中,合併(join)是透過 DataFrame 的 .join() 方法完成。這個方法需要三個參數。第一個是你要和第一個 DataFrame 進行合併的第二個 DataFrame。第二個參數 on 是鍵欄位的名稱(字串)。各資料表中的鍵欄位名稱必須相同。第三個參數 how 指定要執行的合併類型。在本課程中,我們一律使用 how="leftouter"

flights 資料集和一個名為 airports 的新資料集已經在你的工作區中。

本練習屬於課程

PySpark 基礎

檢視課程

練習說明

  • 透過呼叫 .show() 檢視 airports DataFrame。注意哪一個鍵欄位可以用來把 airportsflights 表合併。
  • 透過將 airports.withColumnRenamed("faa", "dest") 的結果重新指定給 airports,把 airports 中的 faa 欄位重新命名為 dest
  • dest 欄位上,對 flights 呼叫 .join(),與 airports DataFrame 進行合併,並將結果儲存為 flights_with_airports
    • 第一個參數應為另一個 DataFrame,也就是 airports
    • 參數 on 應為鍵欄位。
    • 參數 how 應為 "leftouter"
  • flights_with_airports 呼叫 .show() 再次檢視資料。留意新增了哪些資訊。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Examine the data
print(____)

# Rename the faa column
airports = ____

# Join the DataFrames
flights_with_airports = ____

# Examine the new DataFrame
print(____)
編輯並執行程式碼