CommencezCommencez gratuitement

RDD à partir de collections parallélisées

Un Resilient Distributed Dataset (RDD) est l'abstraction de base dans Spark. Il s'agit d'une collection distribuée et immuable d'objets. Comme le RDD est un type de données fondamental et central dans Spark, il est important de savoir comment en créer un. Dans cet exercice, vous allez créer votre premier RDD en PySpark à partir d'une collection de mots.

Rappelez‑vous que vous avez déjà un SparkContext sc disponible dans votre espace de travail.

Cette activité fait partie du cours

Principes de Big Data avec PySpark

Voir le cours

Instructions de l’exercice

  • Créez un RDD nommé RDD à partir d'une liste Python de mots.
  • Confirmez que l'objet créé est un RDD.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create an RDD from a list of words
RDD = sc.____(["Spark", "is", "a", "framework", "for", "Big Data processing"])

# Print out the type of the created object
print("The type of RDD is", ____(RDD))
Modifier et exécuter le code