Práce s RDD pomocí collect()
V tomto cvičení budeš pracovat s RDD i DataFrames v PySparku. Cílem je seskupit data a provést agregaci pomocí operací s RDD i metod DataFrames.
Načteš CSV soubor s daty o platech zaměstnanců do PySparku jako RDD. Poté seskupíš data podle úrovně zkušeností a vypočítáš maximální plat pro každou úroveň z DataFramu. Díky tomu uvidíš, v čem každý z těchto formátů vyniká.
Dataset obsahuje data o platech datových vědců – sledování trendů na trhu práce se ti může hodit! Data jsme za tebe už načetli a normalizovali. Nezapomeň, že v tvém workspace je k dispozici SparkSession pojmenovaná spark!
Toto cvičení je součástí kurzu
Introduction to PySpark
Pokyny k cvičení
- Vytvoř RDD z DataFramu.
- Načti a zobraz výsledky z RDD i DataFramu.
- Seskup data podle
"experience_level"a vypočítej maximální plat pro každou úroveň.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create an RDD from the df_salaries
rdd_salaries = df_salaries.____
# Collect and print the results
print(rdd_salaries.____)
# Group by the experience level and calculate the maximum salary
dataframe_results = df_salaries.____("experience_level").____({"salary_in_usd": 'max'})
# Show the results
dataframe_results.____