CSV の読み込みと集計の実行
規模が小さい企業から大きな企業まで、さまざまな会社のデータサイエンティストの給与データがスプレッドシートにまとめられています。会社の規模ごとにグループ化した平均給与に大きな差があるかどうかを確認しましょう。
ワークスペースには、すでに SparkSession という spark があります。
この演習はコースの一部です
PySpark 入門
演習の手順
- CSVファイルをDataFrameとして読み込み、スキーマを自動推定します。
- 行数のカウントを返します。
company_size列でグループ化し、salary_in_usdを使って平均給与を計算します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Load the CSV file into a DataFrame
salaries_df = ____("salaries.csv", header=True, inferSchema=____)
# Count the total number of rows
row_count = salaries_df.____
print(f"Total rows: {row_count}")
# Group by company size and calculate the average of salaries
salaries_df.____("company_size").____({"salary_in_usd": "avg"}).show()
salaries_df.show()