Vytvoř základní RDD a transformuj ho
Množství nestrukturovaných dat (řádky logů, obrázky, binární soubory) neustále rychle roste a PySpark je skvělý framework pro analýzu tohoto typu dat prostřednictvím RDD. V tomto třídílném cvičení napíšeš kód, který najde nejčastěji se vyskytující slova v Souborném díle Williama Shakespearea.
Tady jsou stručné kroky pro napsání programu na počítání slov:
- Vytvoř základní RDD ze souboru
Complete_Shakespeare.txt. - Pomocí transformace RDD vytvoř dlouhý seznam slov z každého prvku základního RDD.
- Odstraň z dat stop slova.
- Vytvoř párové RDD, kde každý prvek je dvojice tuple ve tvaru
('w', 1). - Seskup prvky párového RDD podle klíče (slova) a sečti jejich hodnoty.
- Prohoď klíče (slova) a hodnoty (počty) tak, aby klíčem byl počet a hodnotou slovo.
- Nakonec seřaď RDD sestupně a vypiš 10 nejčastějších slov spolu s jejich frekvencemi.
V tomto prvním cvičení vytvoříš základní RDD ze souboru Complete_Shakespeare.txt a transformuješ ho na dlouhý seznam slov.
Máš v pracovním prostředí k dispozici SparkContext sc. Je tam také načtená proměnná file_path, která obsahuje cestu k souboru Complete_Shakespeare.txt.
Toto cvičení je součástí kurzu
Big Data Fundamentals with PySpark
Pokyny k cvičení
- Vytvoř RDD s názvem
baseRDD, které načte řádky zfile_path. - Transformuj
baseRDDna dlouhý seznam slov a vytvoř novésplitRDD. - Spočítej celkový počet slov v
splitRDD.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create a baseRDD from the file path
baseRDD = sc.____(file_path)
# Split the lines of baseRDD into words
splitRDD = baseRDD.____(lambda x: x.split())
# Count the total number of words
print("Total number of words in splitRDD:", splitRDD.____())