Filtrare și numărare
Transformarea RDD filter() returnează un nou RDD care conține doar elementele ce satisfac o anumită funcție. Este utilă pentru filtrarea seturilor mari de date după un cuvânt-cheie. În acest exercițiu, vei filtra liniile care conțin cuvântul-cheie Spark din RDD-ul fileRDD, care este format din liniile de text ale fișierului README.md. Apoi, vei număra câte linii conțin cuvântul-cheie Spark și, în final, vei afișa primele 4 linii ale RDD-ului filtrat.
Reține că ai deja un SparkContext sc, file_path și fileRDD disponibile în spațiul tău de lucru.
Acest exercițiu face parte din cursul
Fundamentele Big Data cu PySpark
Instrucțiuni pentru exercițiu
- Creează transformarea
filter()pentru a selecta liniile care conțin cuvântul-cheieSpark. - Câte linii din
fileRDD_filterconțin cuvântul-cheieSpark? - Afișează primele patru linii ale RDD-ului rezultat.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Filter the fileRDD to select lines with Spark keyword
fileRDD_filter = fileRDD.filter(lambda line: 'Spark' in ____)
# How many lines are there in fileRDD?
print("The total number of lines with the keyword Spark is", fileRDD_filter.____())
# Print the first four lines of fileRDD
for line in fileRDD_filter.____(____):
print(line)