开始使用免费开始使用

数据中的分区

SparkContext 的 textFile() 方法有一个可选的第二个参数 minPartitions,用于指定最小分区数。本练习中,您将创建一个拥有 5 个分区、名为 fileRDD_part 的 RDD,然后与上一练习中创建的 fileRDD 进行比较。请参考视频 2.1 中的 "Understanding Partition" 幻灯片,了解如何创建 RDD 并获取其分区数量的方法。

请记住,工作区中已经为您提供了 SparkContext scfile_pathfileRDD

本练习是课程的一部分

使用 PySpark 的大数据基础

查看课程

练习说明

  • 查找 fileRDD RDD 的分区数量。
  • 使用该文件路径创建一个名为 fileRDD_part 的 RDD,并将分区数设为 5。
  • 确认新的 fileRDD_part RDD 的分区数量。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Check the number of partitions in fileRDD
print("Number of partitions in fileRDD is", fileRDD.____)

# Create a fileRDD_part from file_path with 5 partitions
fileRDD_part = sc.textFile(____, minPartitions = ____)

# Check the number of partitions in fileRDD_part
print("Number of partitions in fileRDD_part is", fileRDD_part.____)
编辑并运行代码