Filtrera och räkna
RDD-transformationen filter() returnerar en ny RDD som bara innehåller de element som uppfyller en given funktion. Det är ett användbart verktyg för att filtrera stora datamängder baserat på ett nyckelord. I den här övningen filtrerar du ut rader som innehåller nyckelordet Spark från fileRDD – en RDD med textrader från filen README.md. Sedan räknar du det totala antalet rader som innehåller nyckelordet Spark och skriver slutligen ut de första 4 raderna i den filtrerade RDD:n.
Kom ihåg att SparkContext sc, file_path och fileRDD redan finns tillgängliga i din arbetsmiljö.
Den här övningen är en del av kursen
Grunderna i Big Data med PySpark
Övningsinstruktioner
- Skapa en
filter()-transformation som väljer ut de rader som innehåller nyckelordetSpark. - Hur många rader i
fileRDD_filterinnehåller nyckelordetSpark? - Skriv ut de första fyra raderna i den resulterande RDD:n.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Filter the fileRDD to select lines with Spark keyword
fileRDD_filter = fileRDD.filter(lambda line: 'Spark' in ____)
# How many lines are there in fileRDD?
print("The total number of lines with the keyword Spark is", fileRDD_filter.____())
# Print the first four lines of fileRDD
for line in fileRDD_filter.____(____):
print(line)