Zacznij terazZacznij za darmo

RDD z kolekcji równoległych

Resilient Distributed Dataset (RDD) to podstawowa abstrakcja w Sparku. Jest to niezmienna, rozproszona kolekcja obiektów. Ponieważ RDD stanowi fundamentalny typ danych w Sparku, warto wiedzieć, jak go tworzyć. W tym ćwiczeniu stworzysz swój pierwszy RDD w PySparku na podstawie kolekcji słów.

Pamiętaj, że w swoim środowisku pracy masz już dostępny SparkContext sc.

To ćwiczenie jest częścią kursu

Podstawy Big Data z PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz RDD o nazwie RDD z listy Pythona zawierającej słowa.
  • Sprawdź, czy utworzony obiekt jest RDD.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Create an RDD from a list of words
RDD = sc.____(["Spark", "is", "a", "framework", "for", "Big Data processing"])

# Print out the type of the created object
print("The type of RDD is", ____(RDD))
Edytuj i uruchom kod