Samla in RDD:er
I den här övningen arbetar du med både RDD:er och DataFrames i PySpark. Målet är att gruppera data och utföra aggregering med hjälp av både RDD-operationer och DataFrame-metoder.
Du laddar in en CSV-fil med lönedata för anställda i PySpark som en RDD. Sedan grupperar du data efter erfarenhetsnivå och beräknar maxlönen för varje erfarenhetsnivå från en DataFrame. På så sätt får du en tydlig bild av styrkorna hos båda dataformaten.
Datamängden innehåller lönedata för datavetare – att hitta trender på marknaden är definitivt värt mödan! Vi har redan laddat in och normaliserat data åt dig. Kom ihåg att det redan finns en SparkSession som heter spark i din arbetsyta!
Den här övningen är en del av kursen
Introduktion till PySpark
Övningsinstruktioner
- Skapa en RDD från en DataFrame.
- Samla in och visa resultaten från RDD:n och DataFrame.
- Gruppera efter
"experience_level"och beräkna maxlönen för varje grupp.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create an RDD from the df_salaries
rdd_salaries = df_salaries.____
# Collect and print the results
print(rdd_salaries.____)
# Group by the experience level and calculate the maximum salary
dataframe_results = df_salaries.____("experience_level").____({"salary_in_usd": 'max'})
# Show the results
dataframe_results.____