始める無料で始める

CSV の読み込みと集計の実行

規模が小さい企業から大きな企業まで、さまざまな会社のデータサイエンティストの給与データがスプレッドシートにまとめられています。会社の規模ごとにグループ化した平均給与に大きな差があるかどうかを確認しましょう。

ワークスペースには、すでに SparkSession という spark があります。

この演習はコースの一部です

PySpark 入門

コースを見る

演習の手順

  • CSVファイルをDataFrameとして読み込み、スキーマを自動推定します。
  • 行数のカウントを返します。
  • company_size 列でグループ化し、salary_in_usd を使って平均給与を計算します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Load the CSV file into a DataFrame
salaries_df = ____("salaries.csv", header=True, inferSchema=____)

# Count the total number of rows
row_count = salaries_df.____
print(f"Total rows: {row_count}")

# Group by company size and calculate the average of salaries
salaries_df.____("company_size").____({"salary_in_usd": "avg"}).show()
salaries_df.show()
コードを編集して実行