连接 II
在 PySpark 中,连接通过 DataFrame 方法 .join() 完成。该方法接收三个参数。第一个参数是要与第一个 DataFrame 连接的第二个 DataFrame。第二个参数 on 是键列名(可以是多个列名)的字符串。各表中的键列名必须相同。第三个参数 how 指定连接类型。本课程中我们始终使用 how="leftouter"。
flights 数据集和一个名为 airports 的新数据集已在您的工作区中。
本练习是课程的一部分
PySpark 基础
练习说明
- 通过调用
.show()查看airportsDataFrame。请留意可用于将airports与flights表连接的键列。 - 将
airports中的faa列重命名为dest,方法是将airports.withColumnRenamed("faa", "dest")的结果重新赋值给airports。 - 在
dest列上将flights与airportsDataFrame 连接,方法是在flights上调用.join()。将结果保存为flights_with_airports。- 第一个参数应为另一个 DataFrame,即
airports。 - 参数
on应为键列。 - 参数
how应为"leftouter"。
- 第一个参数应为另一个 DataFrame,即
- 对
flights_with_airports调用.show()再次查看数据。注意新增的信息。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Examine the data
print(____)
# Rename the faa column
airports = ____
# Join the DataFrames
flights_with_airports = ____
# Examine the new DataFrame
print(____)