编写 Spark 配置
既然您已经查看了集群上的一些 Spark 配置,接下来您想调整部分设置,以便让 Spark 更贴合您的需求。您将导入一些数据,以确认这些更改确实影响到了集群。
Spark 配置最初设置为默认的 200 个分区。
spark 对象可直接使用。名为 departures.txt.gz 的文件可供导入。一个包含 departures.txt.gz 中去重行的初始 DataFrame 已以 departures_df 提供。
本练习是课程的一部分
使用 PySpark 进行数据清洗
练习说明
- 将
departures_df的分区数存入变量before。 - 将
spark.sql.shuffle.partitions配置更改为 500 个分区。 - 重新创建
departures_dfDataFrame,读取 departures 文件中的去重行。 - 打印配置修改前后各自的分区数。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Store the number of partitions in variable
before = departures_df.____
# Configure Spark to use 500 partitions
____('spark.sql.shuffle.partitions', ____)
# Recreate the DataFrame using the departures data file
departures_df = spark.read.csv('departures.txt.gz').____
# Print the number of partitions for each instance
print("Partition count before change: %d" % ____)
print("Partition count after change: %d" % ____)