CommencezCommencez gratuitement

RDD vers DataFrame

Tout comme les RDD, les DataFrames sont des structures de données immuables et distribuées dans Spark. Même si les RDD sont une structure fondamentale dans Spark, il est plus simple de travailler avec des données dans des DataFrames que dans des RDD. Il est donc essentiel de savoir convertir un RDD en DataFrame.

Dans cet exercice, vous allez d'abord créer un RDD à partir de sample_list, déjà fournie. Ce RDD contient une liste de tuples ('Mona',20), ('Jennifer',34),('John',20), ('Jim',26) où chaque tuple comprend le nom d'une personne et son âge. Ensuite, vous créerez un DataFrame à partir du RDD et du schéma (la liste « Name » et « Age »), puis vous confirmerez finalement que le résultat est un DataFrame PySpark.

N'oubliez pas : vous avez déjà un SparkContext sc et une SparkSession spark disponibles dans votre espace de travail.

Cette activité fait partie du cours

Principes de Big Data avec PySpark

Voir le cours

Instructions de l’exercice

  • Créez un RDD à partir de sample_list.
  • Créez un DataFrame PySpark à l'aide du RDD et du schéma ci-dessus.
  • Confirmez que le résultat est un DataFrame PySpark.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create an RDD from the list
rdd = sc.____(sample_list)

# Create a PySpark DataFrame
names_df = spark.createDataFrame(____, ____=['Name', 'Age'])

# Check the type of names_df
print("The type of names_df is", ____(names_df))
Modifier et exécuter le code