ÎncepețiÎncepe gratuit

RDD-uri din colecții parallelizate

Resilient Distributed Dataset (RDD) este abstracția de bază în Spark – o colecție distribuită și imuabilă de obiecte. Deoarece RDD reprezintă tipul fundamental de date în Spark, este important să știi cum să îl creezi. În acest exercițiu, vei crea primul tău RDD în PySpark dintr-o colecție de cuvinte.

Reține că ai deja un SparkContext sc disponibil în spațiul de lucru.

Acest exercițiu face parte din cursul

Fundamentele Big Data cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează un RDD numit RDD dintr-o listă Python de cuvinte.
  • Confirmă că obiectul creat este un RDD.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create an RDD from a list of words
RDD = sc.____(["Spark", "is", "a", "framework", "for", "Big Data processing"])

# Print out the type of the created object
print("The type of RDD is", ____(RDD))
Editează și rulează codul