Tworzenie bazowego RDD i jego transformacja
Ilość nieustrukturyzowanych danych (logi, obrazy, pliki binarne) rośnie w błyskawicznym tempie, a PySpark to doskonałe narzędzie do analizy tego typu danych za pomocą RDD. W tym ćwiczeniu składającym się z 3 części napiszesz kod, który wyznacza najczęściej występujące słowa w Dziełach wszystkich Williama Szekspira.
Oto krótki opis kroków programu zliczającego słowa:
- Utwórz bazowy RDD z pliku
Complete_Shakespeare.txt. - Użyj transformacji RDD, aby z każdego elementu bazowego RDD uzyskać listę pojedynczych słów.
- Usuń ze swoich danych słowa funkcyjne (stop words).
- Utwórz pair RDD, w którym każdy element to krotka pary
('w', 1). - Pogrupuj elementy pair RDD według klucza (słowa) i zsumuj ich wartości.
- Zamień klucze (słowa) z wartościami (liczbami wystąpień), tak aby kluczem była liczba, a wartością słowo.
- Na koniec posortuj RDD malejąco i wyświetl 10 najczęstszych słów wraz z ich częstotliwościami.
W tej pierwszej części ćwiczenia utworzysz bazowy RDD z pliku Complete_Shakespeare.txt i poddasz go transformacji, aby otrzymać listę pojedynczych słów.
Pamiętaj, że w swoim środowisku roboczym masz już dostępny SparkContext sc. Zmienna file_path (ścieżka do pliku Complete_Shakespeare.txt) jest również wczytana automatycznie.
To ćwiczenie jest częścią kursu
Podstawy Big Data z PySpark
Instrukcje do ćwiczenia
- Utwórz RDD o nazwie
baseRDD, który wczytuje wiersze zfile_path. - Przekształć
baseRDDw listę pojedynczych słów i zapisz wynik jako nowysplitRDD. - Policz łączną liczbę słów w
splitRDD.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create a baseRDD from the file path
baseRDD = sc.____(file_path)
# Split the lines of baseRDD into words
splitRDD = baseRDD.____(lambda x: x.split())
# Count the total number of words
print("Total number of words in splitRDD:", splitRDD.____())