Kiểu dữ liệu đánh giá
Markus xem rất nhiều phim, gồm cả tài liệu, siêu anh hùng, kinh điển và chính kịch. Dựa trên kinh nghiệm trước đây của bạn với Spark, hãy dùng dataframe markus_ratings, chứa số lần Markus đã xem phim theo từng thể loại, và suy nghĩ xem đây là đánh giá ẩn (implicit) hay tường minh (explicit). Sử dụng phương thức groupBy() để xác định thể loại nào có số lần xem cao nhất, điều này có thể ảnh hưởng đến các gợi ý mà ALS sẽ tạo cho Markus.
Bài tập này là một phần của khóa học
Xây dựng Recommendation Engine với PySpark
Hướng dẫn bài tập
- Dùng phương thức
groupBy()để nhóm dataframemarkus_ratingstheo"Genre". - Áp dụng phương thức
.sum()để lấy tổng số phim đã xem cho mỗi thể loại. - Nhớ thêm phương thức
.show()ở cuối để xem số đếm.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Group the data by "Genre"
markus_ratings.____("____").____().____()