與評分資料進行連接
在影片練習中,你已經看到如何在 PySpark 中使用轉換,將 film 和 ratings 資料表做連接,來建立每位顧客平均評分的新欄位。
在本練習中,你將運用與影片練習相同的技巧,進一步整合 film 與 ratings 資料表,計算每部電影的平均評分。
包含電影資料的 PySpark DataFrame film_df,以及包含評分資料的 PySpark DataFrame rating_df,都已提供在你的工作區中。
本練習屬於課程
Data Engineering 入門
練習說明
- 取每個
film_id的平均評分,並將結果指定給ratings_per_film_df。 - 完成
.join()陳述式,並在film_id欄位上進行連接。 - 顯示結果 DataFrame 的前
5筆資料。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Use groupBy and mean to aggregate the column
ratings_per_film_df = rating_df.____('____').____('____')
# Join the tables using the film_id column
film_df_with_ratings = film_df.join(
ratings_per_film_df,
film_df.film_id==____
)
# Show the 5 first results
print(film_df_with_ratings.____)