Filtrer et compter
La transformation RDD filter() renvoie un nouvel RDD ne contenant que les éléments qui satisfont une fonction donnée. Elle est utile pour filtrer de grands ensembles de données selon un mot-clé. Dans cet exercice, vous allez extraire les lignes contenant le mot-clé Spark de l'RDD fileRDD, qui regroupe des lignes de texte provenant du fichier README.md. Ensuite, vous compterez le nombre total de lignes contenant le mot-clé Spark et, pour finir, vous afficherez les 4 premières lignes du RDD filtré.
Rappel : vous avez déjà un SparkContext sc, file_path et fileRDD disponibles dans votre espace de travail.
Cette activité fait partie du cours
Principes de Big Data avec PySpark
Instructions de l’exercice
- Créez la transformation
filter()pour sélectionner les lignes contenant le mot-cléSpark. - Combien de lignes dans
fileRDD_filtercontiennent le mot-cléSpark? - Affichez les quatre premières lignes du RDD obtenu.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Filter the fileRDD to select lines with Spark keyword
fileRDD_filter = fileRDD.filter(lambda line: 'Spark' in ____)
# How many lines are there in fileRDD?
print("The total number of lines with the keyword Spark is", fileRDD_filter.____())
# Print the first four lines of fileRDD
for line in fileRDD_filter.____(____):
print(line)