ประเภทข้อมูลคะแนน
Markus ดูหนังหลากหลายประเภท ไม่ว่าจะเป็นสารคดี หนังซูเปอร์ฮีโร่ หนังคลาสสิก และหนังดราม่า จากประสบการณ์ที่ผ่านมากับ Spark ให้ใช้ dataframe markus_ratings ซึ่งบันทึกจำนวนครั้งที่ Markus ดูหนังในแต่ละแนว แล้วพิจารณาว่าข้อมูลเหล่านี้เป็น implicit ratings หรือ explicit ratings จากนั้นใช้เมธอด groupBy() เพื่อหาว่าแนวหนังใดมีคะแนนรวมสูงสุด ซึ่งอาจส่งผลต่อการแนะนำของโมเดล ALS สำหรับ Markus
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การสร้าง Recommendation Engines ด้วย PySpark
คำแนะนำการฝึกหัด
- ใช้เมธอด
groupBy()เพื่อจัดกลุ่มข้อมูลใน dataframemarkus_ratingsตาม"Genre" - ใช้เมธอด
.sum()เพื่อหาจำนวนหนังทั้งหมดที่ดูในแต่ละแนว - อย่าลืมเพิ่มเมธอด
.show()ต่อท้ายเพื่อแสดงผลลัพธ์
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Group the data by "Genre"
markus_ratings.____("____").____().____()