ReduceByKey i Collect
Jedna z najpopularniejszych transformacji par RDD to reduceByKey(), która działa na parach klucz-wartość (k,v) i łączy wartości odpowiadające temu samemu kluczowi. W tym ćwiczeniu najpierw utworzysz parę RDD z listy krotek, następnie połączysz wartości o tym samym kluczu i na końcu wyświetlisz wyniki.
Pamiętaj, że w swoim obszarze roboczym masz już dostępny SparkContext sc.
To ćwiczenie jest częścią kursu
Podstawy Big Data z PySpark
Instrukcje do ćwiczenia
- Utwórz parę RDD o nazwie
Rddz krotkami(1,2),(3,4),(3,6),(4,5). - Przekształć
Rddza pomocąreduceByKey()w parę RDDRdd_Reduced, dodając wartości o tym samym kluczu. - Pobierz zawartość pary RDD
Rdd_Reducedi iteruj po niej, aby wypisać wyniki.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create PairRDD Rdd with key value pairs
Rdd = sc.parallelize([____])
# Apply reduceByKey() operation on Rdd
Rdd_Reduced = Rdd.reduceByKey(lambda x, y: ____)
# Iterate over the result and print the output
for num in Rdd_Reduced.____:
print("Key {} has {} Counts".format(____, num[1]))