CommencezCommencez gratuitement

RDD à partir d'ensembles de données externes

PySpark peut facilement créer des RDD à partir de fichiers stockés sur des dispositifs de stockage externes, comme HDFS (Hadoop Distributed File System), des compartiments Amazon S3, etc. Cependant, la méthode la plus courante pour créer des RDD consiste à partir de fichiers stockés dans votre système de fichiers local. Cette méthode prend un chemin de fichier et le lit comme une collection de lignes. Dans cet exercice, vous allez créer un RDD à partir du chemin de fichier (file_path) avec le nom de fichier README.md, déjà disponible dans votre espace de travail.

N'oubliez pas que vous avez déjà un SparkContext sc dans votre espace de travail.

Cette activité fait partie du cours

Principes de Big Data avec PySpark

Voir le cours

Instructions de l’exercice

  • Affichez file_path dans le shell PySpark.
  • Créez un RDD nommé fileRDD à partir de file_path.
  • Affichez le type du fileRDD créé.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Print the file_path
print("The file_path is", ____)

# Create a fileRDD from file_path
fileRDD = sc.____(file_path)

# Check the type of fileRDD
print("The file type of fileRDD is", type(____))
Modifier et exécuter le code