開始使用免費開始

與評分資料進行連接

在影片練習中,你已經看到如何在 PySpark 中使用轉換,將 filmratings 資料表做連接,來建立每位顧客平均評分的新欄位。 在本練習中,你將運用與影片練習相同的技巧,進一步整合 filmratings 資料表,計算每部電影的平均評分。

包含電影資料的 PySpark DataFrame film_df,以及包含評分資料的 PySpark DataFrame rating_df,都已提供在你的工作區中。

本練習屬於課程

Data Engineering 入門

檢視課程

練習說明

  • 取每個 film_id 的平均評分,並將結果指定給 ratings_per_film_df
  • 完成 .join() 陳述式,並在 film_id 欄位上進行連接。
  • 顯示結果 DataFrame 的前 5 筆資料。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Use groupBy and mean to aggregate the column
ratings_per_film_df = rating_df.____('____').____('____')

# Join the tables using the film_id column
film_df_with_ratings = film_df.join(
    ratings_per_film_df,
    film_df.film_id==____
)

# Show the 5 first results
print(film_df_with_ratings.____)
編輯並執行程式碼