ÎncepețiÎncepe gratuit

Filtrare și numărare

Transformarea RDD filter() returnează un nou RDD care conține doar elementele ce satisfac o anumită funcție. Este utilă pentru filtrarea seturilor mari de date după un cuvânt-cheie. În acest exercițiu, vei filtra liniile care conțin cuvântul-cheie Spark din RDD-ul fileRDD, care este format din liniile de text ale fișierului README.md. Apoi, vei număra câte linii conțin cuvântul-cheie Spark și, în final, vei afișa primele 4 linii ale RDD-ului filtrat.

Reține că ai deja un SparkContext sc, file_path și fileRDD disponibile în spațiul tău de lucru.

Acest exercițiu face parte din cursul

Fundamentele Big Data cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează transformarea filter() pentru a selecta liniile care conțin cuvântul-cheie Spark.
  • Câte linii din fileRDD_filter conțin cuvântul-cheie Spark?
  • Afișează primele patru linii ale RDD-ului rezultat.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Filter the fileRDD to select lines with Spark keyword
fileRDD_filter = fileRDD.filter(lambda line: 'Spark' in ____)

# How many lines are there in fileRDD?
print("The total number of lines with the keyword Spark is", fileRDD_filter.____())

# Print the first four lines of fileRDD
for line in fileRDD_filter.____(____):
  print(line)
Editează și rulează codul