Bắt đầu ngayBắt đầu miễn phí

Phương thức GroupBy và Filter

Giờ bạn đã biết thêm một chút về bộ dữ liệu, hãy xem một vài chỉ số tóm tắt chung của bộ dữ liệu ratings để biết các phim có bao nhiêu lượt đánh giá và mỗi người dùng đã cung cấp bao nhiêu đánh giá.

Hai phương thức phổ biến sẽ hữu ích khi bạn tổng hợp thống kê trong Spark là .filter().groupBy(). Phương thức .filter() cho phép bạn loại bỏ mọi dữ liệu không đáp ứng tiêu chí đã chỉ định.

Bài tập này là một phần của khóa học

Xây dựng Recommendation Engine với PySpark

Xem khóa học

Hướng dẫn bài tập

  • Import col từ pyspark.sql.functions, và xem bộ dữ liệu ratings bằng .show().
  • Áp dụng phương thức .filter() lên bộ dữ liệu ratings với bộ lọc sau trong dấu ngoặc để chỉ lấy các userId nhỏ hơn 100: col("userId") < 100.
  • Gọi phương thức .groupBy() trên bộ dữ liệu ratings để nhóm dữ liệu theo userId. Sau đó gọi .count() để xem mỗi userId đã đánh giá bao nhiêu phim.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import the requisite packages
from pyspark.sql.____ import ____

# View the ratings dataset
____.____()

# Filter to show only userIds less than 100
ratings.____(col("____") < ____).____()

# Group data by userId, count ratings
ratings.____("____").count().show()
Chỉnh sửa và Chạy Mã