ratings との結合
ビデオ演習では、PySpark の変換を使って film テーブルと ratings テーブルを結合し、顧客ごとの平均評価を保存する新しい列を作成する方法を見ました。
この演習では、同じ手法を使って各作品の平均評価を計算し、film と ratings テーブルの連携をさらに強化します。
映画の PySpark DataFrame film_df と、評価の PySpark DataFrame rating_df がワークスペースに用意されています。
この演習はコースの一部です
データエンジニアリング入門
演習の手順
film_idごとに平均評価を計算し、結果をratings_per_film_dfに代入します。.join()の記述を完成させ、film_id列で結合します。- 得られた DataFrame の最初の
5件を表示します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Use groupBy and mean to aggregate the column
ratings_per_film_df = rating_df.____('____').____('____')
# Join the tables using the film_id column
film_df_with_ratings = film_df.join(
ratings_per_film_df,
film_df.film_id==____
)
# Show the 5 first results
print(film_df_with_ratings.____)