Interaktiv användning av PySpark
Spark levereras med ett interaktivt Python-skal där PySpark redan är installerat. PySpark-skalet är användbart för grundläggande testning och felsökning och är ett kraftfullt verktyg. Det enklaste sättet att visa styrkan hos PySpark-skalet är med en praktisk övning. I den här övningen läser du in en enkel lista med tal från 1 till 100 i PySpark-skalet.
Det viktigaste att förstå här är att vi inte skapar något SparkContext-objekt manuellt – PySpark skapar automatiskt SparkContext-objektet med namnet sc i PySpark-skalet.
Den här övningen är en del av kursen
Grunderna i Big Data med PySpark
Övningsinstruktioner
- Skapa en Python-lista med namnet
numbsom innehåller talen 1 till 100. - Läs in listan i Spark med hjälp av Spark Contexts
parallelize-metod och tilldela den till variabelnspark_data.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create a Python list of numbers from 1 to 100
numb = range(____, ____)
# Load the list into PySpark
spark_data = sc.____(numb)