Kom igångKom igång gratis

Map och Collect

Den viktigaste metoden för att manipulera data i PySpark är map(). Transformationen map() tar en funktion och tillämpar den på varje element i RDD:n. Den kan användas för en mängd olika ändamål – allt från att hämta webbplatsen kopplad till varje URL i din samling till att helt enkelt upphöja tal till en potens. I den här övningen använder du transformationen map() för att kubera varje tal i RDD:n numbRDD som du skapade tidigare. Sedan lagrar du alla element i en variabel och skriver ut resultatet.

Kom ihåg att du redan har ett SparkContext sc och numbRDD tillgängliga i din arbetsyta.

Den här övningen är en del av kursen

Grunderna i Big Data med PySpark

Visa kurs

Övningsinstruktioner

  • Skapa en map()-transformation som kuberar alla tal i numbRDD.
  • Samla resultaten i en variabel som heter numbers_all.
  • Skriv ut utdata från variabeln numbers_all.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Create map() transformation to cube numbers
cubedRDD = numbRDD.map(lambda x: ____)

# Collect the results
numbers_all = cubedRDD.____()

# Print the numbers from numbers_all
for numb in ____:
	print(____)
Redigera och kör kod