複雑な集計
組み込みの集計メソッドをさらに使いこなせるよう、少し複雑な集計に挑戦しましょう。ここでの目標は、複数のコマンドを1行にまとめることです。
なお、spark という名前の SparkSession と、Spark DataFrame の salaries_df はすでにワークスペースに用意されています。
この演習はコースの一部です
PySpark 入門
演習の手順
"salary_in_usd"列を使って、米国大企業の平均給与を計算しましょう。- 米国大企業の給与の合計を計算しましょう。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Average salaries at large us companies
large_companies=salaries_df.filter(salaries_df.company_size == "L").filter(salaries_df.company_location == "US").groupBy().____
#set a large companies variable for other analytics
large_companies=salaries_df.filter(salaries_df.company_size == "L").filter(salaries_df.company_location == "US")
# Total salaries in usd
large_companies.groupBy().____.show()