开始使用免费开始使用

编写 Spark 配置

既然您已经查看了集群上的一些 Spark 配置,接下来您想调整部分设置,以便让 Spark 更贴合您的需求。您将导入一些数据,以确认这些更改确实影响到了集群。

Spark 配置最初设置为默认的 200 个分区。

spark 对象可直接使用。名为 departures.txt.gz 的文件可供导入。一个包含 departures.txt.gz 中去重行的初始 DataFrame 已以 departures_df 提供。

本练习是课程的一部分

使用 PySpark 进行数据清洗

查看课程

练习说明

  • departures_df 的分区数存入变量 before
  • spark.sql.shuffle.partitions 配置更改为 500 个分区。
  • 重新创建 departures_df DataFrame,读取 departures 文件中的去重行。
  • 打印配置修改前后各自的分区数。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Store the number of partitions in variable
before = departures_df.____

# Configure Spark to use 500 partitions
____('spark.sql.shuffle.partitions', ____)

# Recreate the DataFrame using the departures data file
departures_df = spark.read.csv('departures.txt.gz').____

# Print the number of partitions for each instance
print("Partition count before change: %d" % ____)
print("Partition count after change: %d" % ____)
编辑并运行代码