RDD z kolekcji równoległych
Resilient Distributed Dataset (RDD) to podstawowa abstrakcja w Sparku. Jest to niezmienna, rozproszona kolekcja obiektów. Ponieważ RDD stanowi fundamentalny typ danych w Sparku, warto wiedzieć, jak go tworzyć. W tym ćwiczeniu stworzysz swój pierwszy RDD w PySparku na podstawie kolekcji słów.
Pamiętaj, że w swoim środowisku pracy masz już dostępny SparkContext sc.
To ćwiczenie jest częścią kursu
Podstawy Big Data z PySpark
Instrukcje do ćwiczenia
- Utwórz RDD o nazwie
RDDz listy Pythona zawierającej słowa. - Sprawdź, czy utworzony obiekt jest RDD.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create an RDD from a list of words
RDD = sc.____(["Spark", "is", "a", "framework", "for", "Big Data processing"])
# Print out the type of the created object
print("The type of RDD is", ____(RDD))