RDD à partir de collections parallélisées
Un Resilient Distributed Dataset (RDD) est l'abstraction de base dans Spark. Il s'agit d'une collection distribuée et immuable d'objets. Comme le RDD est un type de données fondamental et central dans Spark, il est important de savoir comment en créer un. Dans cet exercice, vous allez créer votre premier RDD en PySpark à partir d'une collection de mots.
Rappelez‑vous que vous avez déjà un SparkContext sc disponible dans votre espace de travail.
Cette activité fait partie du cours
Principes de Big Data avec PySpark
Instructions de l’exercice
- Créez un RDD nommé
RDDà partir d'une liste Python de mots. - Confirmez que l'objet créé est un RDD.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create an RDD from a list of words
RDD = sc.____(["Spark", "is", "a", "framework", "for", "Big Data processing"])
# Print out the type of the created object
print("The type of RDD is", ____(RDD))