Map och Collect
Den viktigaste metoden för att manipulera data i PySpark är map(). Transformationen map() tar en funktion och tillämpar den på varje element i RDD:n. Den kan användas för en mängd olika ändamål – allt från att hämta webbplatsen kopplad till varje URL i din samling till att helt enkelt upphöja tal till en potens. I den här övningen använder du transformationen map() för att kubera varje tal i RDD:n numbRDD som du skapade tidigare. Sedan lagrar du alla element i en variabel och skriver ut resultatet.
Kom ihåg att du redan har ett SparkContext sc och numbRDD tillgängliga i din arbetsyta.
Den här övningen är en del av kursen
Grunderna i Big Data med PySpark
Övningsinstruktioner
- Skapa en
map()-transformation som kuberar alla tal inumbRDD. - Samla resultaten i en variabel som heter
numbers_all. - Skriv ut utdata från variabeln
numbers_all.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create map() transformation to cube numbers
cubedRDD = numbRDD.map(lambda x: ____)
# Collect the results
numbers_all = cubedRDD.____()
# Print the numbers from numbers_all
for numb in ____:
print(____)