Skapa ett bas-RDD och transformera det
Mängden ostrukturerad data – loggfiler, bilder och binärfiler – ökar dramatiskt, och PySpark är ett utmärkt ramverk för att analysera den här typen av data med hjälp av RDD:er. I den här övningen, som består av tre delar, skriver du kod som beräknar de vanligaste orden i Complete Works of William Shakespeare.
Här är en kort översikt över stegen i ordräkningsprogrammet:
- Skapa ett bas-RDD från filen
Complete_Shakespeare.txt. - Använd en RDD-transformation för att skapa en lång lista med ord från varje element i bas-RDD:t.
- Ta bort stoppord från dina data.
- Skapa ett par-RDD där varje element är ett par-tupel av typen
('w', 1). - Gruppera elementen i par-RDD:t efter nyckel (ord) och summera deras värden.
- Byt plats på nycklarna (ord) och värdena (antal) så att nyckeln är antalet och värdet är ordet.
- Sortera slutligen RDD:t i fallande ordning och skriv ut de 10 vanligaste orden tillsammans med deras frekvenser.
I den här första övningen skapar du ett bas-RDD från filen Complete_Shakespeare.txt och transformerar det till en lång lista med ord.
Kom ihåg att du redan har ett SparkContext sc tillgängligt i din arbetsmiljö. En variabel file_path – som innehåller sökvägen till filen Complete_Shakespeare.txt – är också förberedd åt dig.
Den här övningen är en del av kursen
Grunderna i Big Data med PySpark
Övningsinstruktioner
- Skapa ett RDD med namnet
baseRDDsom läser rader frånfile_path. - Transformera
baseRDDtill en lång lista med ord och skapa ett nyttsplitRDD. - Räkna det totala antalet ord i
splitRDD.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create a baseRDD from the file path
baseRDD = sc.____(file_path)
# Split the lines of baseRDD into words
splitRDD = baseRDD.____(lambda x: x.split())
# Count the total number of words
print("Total number of words in splitRDD:", splitRDD.____())