Map a Collect
Hlavní metodou pro práci s daty v PySparku je transformace map(). Bere funkci jako argument a aplikuje ji na každý prvek RDD. Dá se použít na cokoliv – od načítání webových stránek pro každé URL v kolekci až po jednoduché umocňování čísel. V tomto cvičení použiješ transformaci map() k umocnění každého čísla ze numbRDD na třetí. Pak uložíš všechny prvky do proměnné a výsledek vypíšeš.
Nezapomeň, že SparkContext sc a numbRDD máš v pracovním prostoru k dispozici.
Toto cvičení je součástí kurzu
Big Data Fundamentals with PySpark
Pokyny k cvičení
- Vytvoř transformaci
map(), která umocní všechna čísla vnumbRDDna třetí. - Výsledky ulož do proměnné
numbers_all. - Vypiš výstup z proměnné
numbers_all.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create map() transformation to cube numbers
cubedRDD = numbRDD.map(lambda x: ____)
# Collect the results
numbers_all = cubedRDD.____()
# Print the numbers from numbers_all
for numb in ____:
print(____)