Kom igångKom igång gratis

RDD:er från parallelliserade samlingar

En Resilient Distributed Dataset (RDD) är den grundläggande abstraktionen i Spark – en oföränderlig, distribuerad samling av objekt. Eftersom RDD är en central datatyp i Spark är det viktigt att du förstår hur man skapar en. I den här övningen skapar du din första RDD i PySpark från en samling ord.

Kom ihåg att du redan har en SparkContext sc tillgänglig i din arbetsyta.

Den här övningen är en del av kursen

Grunderna i Big Data med PySpark

Visa kurs

Övningsinstruktioner

  • Skapa en RDD med namnet RDD från en Python-lista med ord.
  • Bekräfta att det skapade objektet är en RDD.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Create an RDD from a list of words
RDD = sc.____(["Spark", "is", "a", "framework", "for", "Big Data processing"])

# Print out the type of the created object
print("The type of RDD is", ____(RDD))
Redigera och kör kod