数据中的分区
SparkContext 的 textFile() 方法有一个可选的第二个参数 minPartitions,用于指定最小分区数。本练习中,您将创建一个拥有 5 个分区、名为 fileRDD_part 的 RDD,然后与上一练习中创建的 fileRDD 进行比较。请参考视频 2.1 中的 "Understanding Partition" 幻灯片,了解如何创建 RDD 并获取其分区数量的方法。
请记住,工作区中已经为您提供了 SparkContext sc、file_path 和 fileRDD。
本练习是课程的一部分
使用 PySpark 的大数据基础
练习说明
- 查找
fileRDDRDD 的分区数量。 - 使用该文件路径创建一个名为
fileRDD_part的 RDD,并将分区数设为 5。 - 确认新的
fileRDD_partRDD 的分区数量。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Check the number of partitions in fileRDD
print("Number of partitions in fileRDD is", fileRDD.____)
# Create a fileRDD_part from file_path with 5 partitions
fileRDD_part = sc.textFile(____, minPartitions = ____)
# Check the number of partitions in fileRDD_part
print("Number of partitions in fileRDD_part is", fileRDD_part.____)