Map i Collect
Główną metodą manipulowania danymi w PySpark jest map(). Transformacja map() przyjmuje funkcję i stosuje ją do każdego elementu RDD. Można jej używać do różnych celów – od pobierania stron internetowych powiązanych z adresami URL po zwykłe podnoszenie liczb do potęgi. W tym ćwiczeniu użyjesz transformacji map(), aby obliczyć sześcian każdej liczby z RDD numbRDD, który wcześniej utworzyłeś. Następnie zapiszesz wszystkie elementy w zmiennej i wyświetlisz wynik.
Pamiętaj, że masz już dostęp do SparkContext sc oraz numbRDD w swoim środowisku pracy.
To ćwiczenie jest częścią kursu
Podstawy Big Data z PySpark
Instrukcje do ćwiczenia
- Utwórz transformację
map(), która oblicza sześcian każdej liczby znumbRDD. - Zbierz wyniki w zmiennej
numbers_all. - Wyświetl dane wyjściowe ze zmiennej
numbers_all.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create map() transformation to cube numbers
cubedRDD = numbRDD.map(lambda x: ____)
# Collect the results
numbers_all = cubedRDD.____()
# Print the numbers from numbers_all
for numb in ____:
print(____)