パート1:CSVファイルからDataFrameを作成する
4年に一度、世界中のサッカーファンが“Fifa World Cup”を祝います。開催国だけでなく多くの国で、あらゆるものが特別な雰囲気に包まれます。この3部構成の演習では、PySpark SQLを使って「FIFA 2018 World Cup Player」データセットの探索的データ分析(EDA)を行います。ここではDataFrame操作、SQLクエリ、可視化を扱います。
まずは、CSV形式のFIFA 2018 World Cup Playersデータセット(Fifa2018_dataset.csv)をPySparkのDataFrameに読み込み、基本的なDataFrame操作でデータを確認します。
作業スペースには、すでにSparkSessionの spark と、ファイルへのパスを表す変数 file_path が用意されています。
この演習はコースの一部です
PySparkで学ぶBig Data入門
演習の手順
file_path(Fifa2018_dataset.csvへのパス)からPySparkのDataFrameを作成します。- DataFrameのスキーマを表示します。
- 先頭10件のレコードを表示します。
- DataFrameには何行ありますか?
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Load the Dataframe
fifa_df = spark.____(____, header=True, inferSchema=True)
# Check the schema of columns
fifa_df.____()
# Show the first 10 observations
fifa_df.____(____)
# Print the total number of rows
print("There are {} rows in the fifa_df DataFrame".format(fifa_df.____()))