Filtrování a počítání
Transformace RDD filter() vrátí nové RDD obsahující pouze prvky, které splňují zadanou funkci. Hodí se pro filtrování velkých datových sad podle klíčového slova. V tomto cvičení vyfiltrujete z RDD fileRDD — které obsahuje řádky textu ze souboru README.md — řádky s klíčovým slovem Spark. Pak spočítáš celkový počet těchto řádků a nakonec vypíšeš první 4 řádky filtrovaného RDD.
Pamatuj, že ve svém pracovním prostoru už máš k dispozici SparkContext sc, file_path a fileRDD.
Toto cvičení je součástí kurzu
Big Data Fundamentals with PySpark
Pokyny k cvičení
- Vytvoř transformaci
filter(), která vybere řádky obsahující klíčové slovoSpark. - Kolik řádků v
fileRDD_filterobsahuje klíčové slovoSpark? - Vypiš první čtyři řádky výsledného RDD.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Filter the fileRDD to select lines with Spark keyword
fileRDD_filter = fileRDD.filter(lambda line: 'Spark' in ____)
# How many lines are there in fileRDD?
print("The total number of lines with the keyword Spark is", fileRDD_filter.____())
# Print the first four lines of fileRDD
for line in fileRDD_filter.____(____):
print(line)