使用惰性处理
惰性处理操作通常会在大致相同的时间内返回结果,而不受实际数据量的影响。请记住,这是因为 Spark 在需要执行某个 action 之前不会真正进行任何转换。
在本练习中,您将定义一个 Data Frame(aa_dfw_df)并添加几步转换。请注意:在仅定义转换与实际查询数据时,完成所需的时间不同。差异也许很小,但仍能观察到。当在完整的 Spark 集群上处理更大规模的数据时,这种差异会更加明显。
本练习是课程的一部分
使用 PySpark 进行数据清洗
练习说明
- 加载 Data Frame。
- 对
Destination Airport列添加F.lower()转换。 - 显示 Data Frame,并留意该操作完成所需的时间差。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Load the CSV file
aa_dfw_df = ____.____.____('csv').options(Header=True).load('AA_DFW_2018.csv.gz')
# Add the airport column using the F.lower() method
aa_dfw_df = aa_dfw_df.withColumn('airport', ____(aa_dfw_df['Destination Airport']))
# Show the DataFrame
____