RDD à partir d'ensembles de données externes
PySpark peut facilement créer des RDD à partir de fichiers stockés sur des dispositifs de stockage externes, comme HDFS (Hadoop Distributed File System), des compartiments Amazon S3, etc. Cependant, la méthode la plus courante pour créer des RDD consiste à partir de fichiers stockés dans votre système de fichiers local. Cette méthode prend un chemin de fichier et le lit comme une collection de lignes. Dans cet exercice, vous allez créer un RDD à partir du chemin de fichier (file_path) avec le nom de fichier README.md, déjà disponible dans votre espace de travail.
N'oubliez pas que vous avez déjà un SparkContext sc dans votre espace de travail.
Cette activité fait partie du cours
Principes de Big Data avec PySpark
Instructions de l’exercice
- Affichez
file_pathdans le shell PySpark. - Créez un RDD nommé
fileRDDà partir defile_path. - Affichez le type du
fileRDDcréé.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Print the file_path
print("The file_path is", ____)
# Create a fileRDD from file_path
fileRDD = sc.____(file_path)
# Check the type of fileRDD
print("The file type of fileRDD is", type(____))