RDD:er från parallelliserade samlingar
En Resilient Distributed Dataset (RDD) är den grundläggande abstraktionen i Spark – en oföränderlig, distribuerad samling av objekt. Eftersom RDD är en central datatyp i Spark är det viktigt att du förstår hur man skapar en. I den här övningen skapar du din första RDD i PySpark från en samling ord.
Kom ihåg att du redan har en SparkContext sc tillgänglig i din arbetsyta.
Den här övningen är en del av kursen
Grunderna i Big Data med PySpark
Övningsinstruktioner
- Skapa en RDD med namnet
RDDfrån en Python-lista med ord. - Bekräfta att det skapade objektet är en RDD.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create an RDD from a list of words
RDD = sc.____(["Spark", "is", "a", "framework", "for", "Big Data processing"])
# Print out the type of the created object
print("The type of RDD is", ____(RDD))