評分資料型別
Markus 看了很多電影,包括紀錄片、超級英雄片、經典片和劇情片。根據你先前在 Spark 的經驗,使用包含 Markus 在各類型電影觀看次數資料的 markus_ratings 資料框,思考這些屬於隱性評分還是顯性評分。使用 groupBy() 方法判斷哪種類型的總觀看次數最高,這很可能會影響 ALS 為 Markus 產生的推薦結果。
本練習屬於課程
使用 PySpark 打造推薦引擎
練習說明
- 使用
groupBy()方法,依照"Genre"對markus_ratings資料框分組。 - 套用
.sum()方法,取得每個類型的總觀看次數。 - 別忘了在最後加上
.show()方法來檢視計數結果。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Group the data by "Genre"
markus_ratings.____("____").____().____()