Kom igångKom igång gratis

Skapa ett bas-RDD och transformera det

Mängden ostrukturerad data – loggfiler, bilder och binärfiler – ökar dramatiskt, och PySpark är ett utmärkt ramverk för att analysera den här typen av data med hjälp av RDD:er. I den här övningen, som består av tre delar, skriver du kod som beräknar de vanligaste orden i Complete Works of William Shakespeare.

Här är en kort översikt över stegen i ordräkningsprogrammet:

  • Skapa ett bas-RDD från filen Complete_Shakespeare.txt.
  • Använd en RDD-transformation för att skapa en lång lista med ord från varje element i bas-RDD:t.
  • Ta bort stoppord från dina data.
  • Skapa ett par-RDD där varje element är ett par-tupel av typen ('w', 1).
  • Gruppera elementen i par-RDD:t efter nyckel (ord) och summera deras värden.
  • Byt plats på nycklarna (ord) och värdena (antal) så att nyckeln är antalet och värdet är ordet.
  • Sortera slutligen RDD:t i fallande ordning och skriv ut de 10 vanligaste orden tillsammans med deras frekvenser.

I den här första övningen skapar du ett bas-RDD från filen Complete_Shakespeare.txt och transformerar det till en lång lista med ord.

Kom ihåg att du redan har ett SparkContext sc tillgängligt i din arbetsmiljö. En variabel file_path – som innehåller sökvägen till filen Complete_Shakespeare.txt – är också förberedd åt dig.

Den här övningen är en del av kursen

Grunderna i Big Data med PySpark

Visa kurs

Övningsinstruktioner

  • Skapa ett RDD med namnet baseRDD som läser rader från file_path.
  • Transformera baseRDD till en lång lista med ord och skapa ett nytt splitRDD.
  • Räkna det totala antalet ord i splitRDD.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Create a baseRDD from the file path
baseRDD = sc.____(file_path)

# Split the lines of baseRDD into words
splitRDD = baseRDD.____(lambda x: x.split())

# Count the total number of words
print("Total number of words in splitRDD:", splitRDD.____())
Redigera och kör kod