Kom igångKom igång gratis

Partitioner i dina data

SparkContexts metod textFile() tar ett valfritt andra argument som heter minPartitions, vilket anger det minsta antalet partitioner. I den här övningen skapar du ett RDD med namnet fileRDD_part med 5 partitioner och jämför sedan det med fileRDD som du skapade i föregående övning. Se bilden "Understanding Partition" i video 2.1 för att lära dig metoderna för att skapa och hämta antalet partitioner i ett RDD.

Kom ihåg att du redan har ett SparkContext sc, file_path och fileRDD tillgängliga i din arbetsyta.

Den här övningen är en del av kursen

Grunderna i Big Data med PySpark

Visa kurs

Övningsinstruktioner

  • Ta reda på antalet partitioner som stöder RDD:t fileRDD.
  • Skapa ett RDD med namnet fileRDD_part från filsökvägen, men med 5 partitioner.
  • Bekräfta antalet partitioner i det nya RDD:t fileRDD_part.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Check the number of partitions in fileRDD
print("Number of partitions in fileRDD is", fileRDD.____)

# Create a fileRDD_part from file_path with 5 partitions
fileRDD_part = sc.textFile(____, minPartitions = ____)

# Check the number of partitions in fileRDD_part
print("Number of partitions in fileRDD_part is", fileRDD_part.____)
Redigera och kör kod