Kom igångKom igång gratis

Filtrera och räkna

RDD-transformationen filter() returnerar en ny RDD som bara innehåller de element som uppfyller en given funktion. Det är ett användbart verktyg för att filtrera stora datamängder baserat på ett nyckelord. I den här övningen filtrerar du ut rader som innehåller nyckelordet Spark från fileRDD – en RDD med textrader från filen README.md. Sedan räknar du det totala antalet rader som innehåller nyckelordet Spark och skriver slutligen ut de första 4 raderna i den filtrerade RDD:n.

Kom ihåg att SparkContext sc, file_path och fileRDD redan finns tillgängliga i din arbetsmiljö.

Den här övningen är en del av kursen

Grunderna i Big Data med PySpark

Visa kurs

Övningsinstruktioner

  • Skapa en filter()-transformation som väljer ut de rader som innehåller nyckelordet Spark.
  • Hur många rader i fileRDD_filter innehåller nyckelordet Spark?
  • Skriv ut de första fyra raderna i den resulterande RDD:n.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Filter the fileRDD to select lines with Spark keyword
fileRDD_filter = fileRDD.filter(lambda line: 'Spark' in ____)

# How many lines are there in fileRDD?
print("The total number of lines with the keyword Spark is", fileRDD_filter.____())

# Print the first four lines of fileRDD
for line in fileRDD_filter.____(____):
  print(line)
Redigera och kör kod