开始使用免费开始使用

使用惰性处理

惰性处理操作通常会在大致相同的时间内返回结果,而不受实际数据量的影响。请记住,这是因为 Spark 在需要执行某个 action 之前不会真正进行任何转换。

在本练习中,您将定义一个 Data Frame(aa_dfw_df)并添加几步转换。请注意:在仅定义转换与实际查询数据时,完成所需的时间不同。差异也许很小,但仍能观察到。当在完整的 Spark 集群上处理更大规模的数据时,这种差异会更加明显。

本练习是课程的一部分

使用 PySpark 进行数据清洗

查看课程

练习说明

  • 加载 Data Frame。
  • Destination Airport 列添加 F.lower() 转换。
  • 显示 Data Frame,并留意该操作完成所需的时间差。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Load the CSV file
aa_dfw_df = ____.____.____('csv').options(Header=True).load('AA_DFW_2018.csv.gz')

# Add the airport column using the F.lower() method
aa_dfw_df = aa_dfw_df.withColumn('airport', ____(aa_dfw_df['Destination Airport']))

# Show the DataFrame
____
编辑并运行代码