Bắt đầu ngayBắt đầu miễn phí

Kiểu dữ liệu đánh giá

Markus xem rất nhiều phim, gồm cả tài liệu, siêu anh hùng, kinh điển và chính kịch. Dựa trên kinh nghiệm trước đây của bạn với Spark, hãy dùng dataframe markus_ratings, chứa số lần Markus đã xem phim theo từng thể loại, và suy nghĩ xem đây là đánh giá ẩn (implicit) hay tường minh (explicit). Sử dụng phương thức groupBy() để xác định thể loại nào có số lần xem cao nhất, điều này có thể ảnh hưởng đến các gợi ý mà ALS sẽ tạo cho Markus.

Bài tập này là một phần của khóa học

Xây dựng Recommendation Engine với PySpark

Xem khóa học

Hướng dẫn bài tập

  • Dùng phương thức groupBy() để nhóm dataframe markus_ratings theo "Genre".
  • Áp dụng phương thức .sum() để lấy tổng số phim đã xem cho mỗi thể loại.
  • Nhớ thêm phương thức .show() ở cuối để xem số đếm.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Group the data by "Genre"
markus_ratings.____("____").____().____()
Chỉnh sửa và Chạy Mã