Joining II
在 PySpark 中,合併(join)是透過 DataFrame 的 .join() 方法完成。這個方法需要三個參數。第一個是你要和第一個 DataFrame 進行合併的第二個 DataFrame。第二個參數 on 是鍵欄位的名稱(字串)。各資料表中的鍵欄位名稱必須相同。第三個參數 how 指定要執行的合併類型。在本課程中,我們一律使用 how="leftouter"。
flights 資料集和一個名為 airports 的新資料集已經在你的工作區中。
本練習屬於課程
PySpark 基礎
練習說明
- 透過呼叫
.show()檢視airportsDataFrame。注意哪一個鍵欄位可以用來把airports與flights表合併。 - 透過將
airports.withColumnRenamed("faa", "dest")的結果重新指定給airports,把airports中的faa欄位重新命名為dest。 - 在
dest欄位上,對flights呼叫.join(),與airportsDataFrame 進行合併,並將結果儲存為flights_with_airports。- 第一個參數應為另一個 DataFrame,也就是
airports。 - 參數
on應為鍵欄位。 - 參數
how應為"leftouter"。
- 第一個參數應為另一個 DataFrame,也就是
- 對
flights_with_airports呼叫.show()再次檢視資料。留意新增了哪些資訊。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Examine the data
print(____)
# Rename the faa column
airports = ____
# Join the DataFrames
flights_with_airports = ____
# Examine the new DataFrame
print(____)