Začněte nyníZačněte zdarma

Filtrování a počítání

Transformace RDD filter() vrátí nové RDD obsahující pouze prvky, které splňují zadanou funkci. Hodí se pro filtrování velkých datových sad podle klíčového slova. V tomto cvičení vyfiltrujete z RDD fileRDD — které obsahuje řádky textu ze souboru README.md — řádky s klíčovým slovem Spark. Pak spočítáš celkový počet těchto řádků a nakonec vypíšeš první 4 řádky filtrovaného RDD.

Pamatuj, že ve svém pracovním prostoru už máš k dispozici SparkContext sc, file_path a fileRDD.

Toto cvičení je součástí kurzu

Big Data Fundamentals with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř transformaci filter(), která vybere řádky obsahující klíčové slovo Spark.
  • Kolik řádků v fileRDD_filter obsahuje klíčové slovo Spark?
  • Vypiš první čtyři řádky výsledného RDD.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Filter the fileRDD to select lines with Spark keyword
fileRDD_filter = fileRDD.filter(lambda line: 'Spark' in ____)

# How many lines are there in fileRDD?
print("The total number of lines with the keyword Spark is", fileRDD_filter.____())

# Print the first four lines of fileRDD
for line in fileRDD_filter.____(____):
  print(line)
Upravit a spustit kód