始める無料で始める

パート1:CSVファイルからDataFrameを作成する

4年に一度、世界中のサッカーファンが“Fifa World Cup”を祝います。開催国だけでなく多くの国で、あらゆるものが特別な雰囲気に包まれます。この3部構成の演習では、PySpark SQLを使って「FIFA 2018 World Cup Player」データセットの探索的データ分析(EDA)を行います。ここではDataFrame操作、SQLクエリ、可視化を扱います。

まずは、CSV形式のFIFA 2018 World Cup Playersデータセット(Fifa2018_dataset.csv)をPySparkのDataFrameに読み込み、基本的なDataFrame操作でデータを確認します。

作業スペースには、すでにSparkSessionの spark と、ファイルへのパスを表す変数 file_path が用意されています。

この演習はコースの一部です

PySparkで学ぶBig Data入門

コースを見る

演習の手順

  • file_pathFifa2018_dataset.csv へのパス)からPySparkのDataFrameを作成します。
  • DataFrameのスキーマを表示します。
  • 先頭10件のレコードを表示します。
  • DataFrameには何行ありますか?

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Load the Dataframe
fifa_df = spark.____(____, header=True, inferSchema=True)

# Check the schema of columns
fifa_df.____()

# Show the first 10 observations
fifa_df.____(____)

# Print the total number of rows
print("There are {} rows in the fifa_df DataFrame".format(fifa_df.____()))
コードを編集して実行