Partitioner i dina data
SparkContexts metod textFile() tar ett valfritt andra argument som heter minPartitions, vilket anger det minsta antalet partitioner. I den här övningen skapar du ett RDD med namnet fileRDD_part med 5 partitioner och jämför sedan det med fileRDD som du skapade i föregående övning. Se bilden "Understanding Partition" i video 2.1 för att lära dig metoderna för att skapa och hämta antalet partitioner i ett RDD.
Kom ihåg att du redan har ett SparkContext sc, file_path och fileRDD tillgängliga i din arbetsyta.
Den här övningen är en del av kursen
Grunderna i Big Data med PySpark
Övningsinstruktioner
- Ta reda på antalet partitioner som stöder RDD:t
fileRDD. - Skapa ett RDD med namnet
fileRDD_partfrån filsökvägen, men med 5 partitioner. - Bekräfta antalet partitioner i det nya RDD:t
fileRDD_part.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Check the number of partitions in fileRDD
print("Number of partitions in fileRDD is", fileRDD.____)
# Create a fileRDD_part from file_path with 5 partitions
fileRDD_part = sc.textFile(____, minPartitions = ____)
# Check the number of partitions in fileRDD_part
print("Number of partitions in fileRDD_part is", fileRDD_part.____)