CommencezCommencez gratuitement

Filtrer et compter

La transformation RDD filter() renvoie un nouvel RDD ne contenant que les éléments qui satisfont une fonction donnée. Elle est utile pour filtrer de grands ensembles de données selon un mot-clé. Dans cet exercice, vous allez extraire les lignes contenant le mot-clé Spark de l'RDD fileRDD, qui regroupe des lignes de texte provenant du fichier README.md. Ensuite, vous compterez le nombre total de lignes contenant le mot-clé Spark et, pour finir, vous afficherez les 4 premières lignes du RDD filtré.

Rappel : vous avez déjà un SparkContext sc, file_path et fileRDD disponibles dans votre espace de travail.

Cette activité fait partie du cours

Principes de Big Data avec PySpark

Voir le cours

Instructions de l’exercice

  • Créez la transformation filter() pour sélectionner les lignes contenant le mot-clé Spark.
  • Combien de lignes dans fileRDD_filter contiennent le mot-clé Spark ?
  • Affichez les quatre premières lignes du RDD obtenu.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Filter the fileRDD to select lines with Spark keyword
fileRDD_filter = fileRDD.filter(lambda line: 'Spark' in ____)

# How many lines are there in fileRDD?
print("The total number of lines with the keyword Spark is", fileRDD_filter.____())

# Print the first four lines of fileRDD
for line in fileRDD_filter.____(____):
  print(line)
Modifier et exécuter le code