SortByKey a Collect
Řazení párového RDD podle klíče se hodí v mnoha situacích (například při počítání výskytů slov, které uvidíš později v této kapitole). V tomto cvičení seřadíš párové RDD Rdd_Reduced, které jsi vytvořil/a v předchozím cvičení, sestupně a vypíšeš výsledný výstup.
Nezapomeň, že SparkContext sc i Rdd_Reduced máš v pracovním prostředí k dispozici.
Toto cvičení je součástí kurzu
Big Data Fundamentals with PySpark
Pokyny k cvičení
- Seřaď RDD
Rdd_Reducedpodle klíče sestupně. - Načti obsah pomocí collect a projdi ho iterací, aby se výstup vypsal.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Sort the reduced RDD with the key by descending order
Rdd_Reduced_Sort = Rdd_Reduced.____(ascending=False)
# Iterate over the result and retrieve all the elements of the RDD
for num in Rdd_Reduced_Sort.____():
print("Key {} has {} Counts".format(____, num[1]))