Začněte nyníZačněte zdarma

Vytvoř základní RDD a transformuj ho

Množství nestrukturovaných dat (řádky logů, obrázky, binární soubory) neustále rychle roste a PySpark je skvělý framework pro analýzu tohoto typu dat prostřednictvím RDD. V tomto třídílném cvičení napíšeš kód, který najde nejčastěji se vyskytující slova v Souborném díle Williama Shakespearea.

Tady jsou stručné kroky pro napsání programu na počítání slov:

  • Vytvoř základní RDD ze souboru Complete_Shakespeare.txt.
  • Pomocí transformace RDD vytvoř dlouhý seznam slov z každého prvku základního RDD.
  • Odstraň z dat stop slova.
  • Vytvoř párové RDD, kde každý prvek je dvojice tuple ve tvaru ('w', 1).
  • Seskup prvky párového RDD podle klíče (slova) a sečti jejich hodnoty.
  • Prohoď klíče (slova) a hodnoty (počty) tak, aby klíčem byl počet a hodnotou slovo.
  • Nakonec seřaď RDD sestupně a vypiš 10 nejčastějších slov spolu s jejich frekvencemi.

V tomto prvním cvičení vytvoříš základní RDD ze souboru Complete_Shakespeare.txt a transformuješ ho na dlouhý seznam slov.

Máš v pracovním prostředí k dispozici SparkContext sc. Je tam také načtená proměnná file_path, která obsahuje cestu k souboru Complete_Shakespeare.txt.

Toto cvičení je součástí kurzu

Big Data Fundamentals with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř RDD s názvem baseRDD, které načte řádky z file_path.
  • Transformuj baseRDD na dlouhý seznam slov a vytvoř nové splitRDD.
  • Spočítej celkový počet slov v splitRDD.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create a baseRDD from the file path
baseRDD = sc.____(file_path)

# Split the lines of baseRDD into words
splitRDD = baseRDD.____(lambda x: x.split())

# Count the total number of words
print("Total number of words in splitRDD:", splitRDD.____())
Upravit a spustit kód