PySpark での集計
それでは、実際に集計を行ってみましょう!
ここでは、これまでにも使用した給与データセットを引き続き使います。どのような集計ができるか、確認してみましょう!
ワークスペースには spark という名前の SparkSession と、Spark DataFrame の salaries_df がすでにワークスペースに用意されています。
この演習はコースの一部です
PySpark 入門
演習の手順
- 米国の小規模企業における最低給与を求めます。フィルタリングは、SQL 文字列ではなく、列を直接参照する形(
"salary_in_usd")で行ってください。 - 米国の大規模企業(
"L"で表されます)における最高給与を求めます。フィルタリングは、SQL 文字列ではなく、列を直接参照する形("salary_in_usd")で行ってください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Find the minimum salaries for small companies
salaries_df.filter(salaries_df.company_size == "S").groupBy().____.show()
# Find the maximum salaries for large companies
salaries_df.filter(salaries_df.company_size ____).____().max("salary_in_usd").show()