始める無料で始める

複雑な集計

組み込みの集計メソッドをさらに使いこなせるよう、少し複雑な集計に挑戦しましょう。ここでの目標は、複数のコマンドを1行にまとめることです。

なお、spark という名前の SparkSession と、Spark DataFrame の salaries_df はすでにワークスペースに用意されています。

この演習はコースの一部です

PySpark 入門

コースを見る

演習の手順

  • "salary_in_usd" 列を使って、米国大企業の平均給与を計算しましょう。
  • 米国大企業の給与の合計を計算しましょう。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Average salaries at large us companies
large_companies=salaries_df.filter(salaries_df.company_size == "L").filter(salaries_df.company_location == "US").groupBy().____

#set a large companies variable for other analytics
large_companies=salaries_df.filter(salaries_df.company_size == "L").filter(salaries_df.company_location == "US")

# Total salaries in usd
large_companies.groupBy().____.show()
コードを編集して実行