Filtrowanie i zliczanie
Transformacja RDD filter() zwraca nowe RDD zawierające tylko te elementy, które spełniają podany warunek. Przydaje się do filtrowania dużych zbiorów danych według słowa kluczowego. W tym ćwiczeniu przefiltruj wiersze zawierające słowo kluczowe Spark z RDD o nazwie fileRDD, który zawiera linie tekstu z pliku README.md. Następnie zlicz łączną liczbę wierszy zawierających słowo Spark i wyświetl pierwsze 4 wiersze przefiltrowanego RDD.
Pamiętaj, że w swoim środowisku masz już dostępny SparkContext sc, zmienną file_path oraz fileRDD.
To ćwiczenie jest częścią kursu
Podstawy Big Data z PySpark
Instrukcje do ćwiczenia
- Utwórz transformację
filter(), która wybiera wiersze zawierające słowo kluczoweSpark. - Ile wierszy w
fileRDD_filterzawiera słowo kluczoweSpark? - Wyświetl pierwsze cztery wiersze wynikowego RDD.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Filter the fileRDD to select lines with Spark keyword
fileRDD_filter = fileRDD.filter(lambda line: 'Spark' in ____)
# How many lines are there in fileRDD?
print("The total number of lines with the keyword Spark is", fileRDD_filter.____())
# Print the first four lines of fileRDD
for line in fileRDD_filter.____(____):
print(line)