RDD-uri din colecții parallelizate
Resilient Distributed Dataset (RDD) este abstracția de bază în Spark – o colecție distribuită și imuabilă de obiecte. Deoarece RDD reprezintă tipul fundamental de date în Spark, este important să știi cum să îl creezi. În acest exercițiu, vei crea primul tău RDD în PySpark dintr-o colecție de cuvinte.
Reține că ai deja un SparkContext sc disponibil în spațiul de lucru.
Acest exercițiu face parte din cursul
Fundamentele Big Data cu PySpark
Instrucțiuni pentru exercițiu
- Creează un RDD numit
RDDdintr-o listă Python de cuvinte. - Confirmă că obiectul creat este un RDD.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create an RDD from a list of words
RDD = sc.____(["Spark", "is", "a", "framework", "for", "Big Data processing"])
# Print out the type of the created object
print("The type of RDD is", ____(RDD))