始める無料で始める

ratings との結合

ビデオ演習では、PySpark の変換を使って film テーブルと ratings テーブルを結合し、顧客ごとの平均評価を保存する新しい列を作成する方法を見ました。 この演習では、同じ手法を使って各作品の平均評価を計算し、filmratings テーブルの連携をさらに強化します。

映画の PySpark DataFrame film_df と、評価の PySpark DataFrame rating_df がワークスペースに用意されています。

この演習はコースの一部です

データエンジニアリング入門

コースを見る

演習の手順

  • film_id ごとに平均評価を計算し、結果を ratings_per_film_df に代入します。
  • .join() の記述を完成させ、film_id 列で結合します。
  • 得られた DataFrame の最初の 5 件を表示します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Use groupBy and mean to aggregate the column
ratings_per_film_df = rating_df.____('____').____('____')

# Join the tables using the film_id column
film_df_with_ratings = film_df.join(
    ratings_per_film_df,
    film_df.film_id==____
)

# Show the 5 first results
print(film_df_with_ratings.____)
コードを編集して実行