Zacznij terazZacznij za darmo

Filtrowanie i zliczanie

Transformacja RDD filter() zwraca nowe RDD zawierające tylko te elementy, które spełniają podany warunek. Przydaje się do filtrowania dużych zbiorów danych według słowa kluczowego. W tym ćwiczeniu przefiltruj wiersze zawierające słowo kluczowe Spark z RDD o nazwie fileRDD, który zawiera linie tekstu z pliku README.md. Następnie zlicz łączną liczbę wierszy zawierających słowo Spark i wyświetl pierwsze 4 wiersze przefiltrowanego RDD.

Pamiętaj, że w swoim środowisku masz już dostępny SparkContext sc, zmienną file_path oraz fileRDD.

To ćwiczenie jest częścią kursu

Podstawy Big Data z PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz transformację filter(), która wybiera wiersze zawierające słowo kluczowe Spark.
  • Ile wierszy w fileRDD_filter zawiera słowo kluczowe Spark?
  • Wyświetl pierwsze cztery wiersze wynikowego RDD.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Filter the fileRDD to select lines with Spark keyword
fileRDD_filter = fileRDD.filter(lambda line: 'Spark' in ____)

# How many lines are there in fileRDD?
print("The total number of lines with the keyword Spark is", fileRDD_filter.____())

# Print the first four lines of fileRDD
for line in fileRDD_filter.____(____):
  print(line)
Edytuj i uruchom kod