始める無料で始める

PySpark での集計

それでは、実際に集計を行ってみましょう! ここでは、これまでにも使用した給与データセットを引き続き使います。どのような集計ができるか、確認してみましょう! ワークスペースには spark という名前の SparkSession と、Spark DataFrame の salaries_df がすでにワークスペースに用意されています。

この演習はコースの一部です

PySpark 入門

コースを見る

演習の手順

  • 米国の小規模企業における最低給与を求めます。フィルタリングは、SQL 文字列ではなく、列を直接参照する形("salary_in_usd")で行ってください。
  • 米国の大規模企業("L" で表されます)における最高給与を求めます。フィルタリングは、SQL 文字列ではなく、列を直接参照する形("salary_in_usd")で行ってください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Find the minimum salaries for small companies
salaries_df.filter(salaries_df.company_size == "S").groupBy().____.show()

# Find the maximum salaries for large companies
salaries_df.filter(salaries_df.company_size ____).____().max("salary_in_usd").show()
コードを編集して実行