Phương thức GroupBy và Filter
Giờ bạn đã biết thêm một chút về bộ dữ liệu, hãy xem một vài chỉ số tóm tắt chung của bộ dữ liệu ratings để biết các phim có bao nhiêu lượt đánh giá và mỗi người dùng đã cung cấp bao nhiêu đánh giá.
Hai phương thức phổ biến sẽ hữu ích khi bạn tổng hợp thống kê trong Spark là .filter() và .groupBy(). Phương thức .filter() cho phép bạn loại bỏ mọi dữ liệu không đáp ứng tiêu chí đã chỉ định.
Bài tập này là một phần của khóa học
Xây dựng Recommendation Engine với PySpark
Hướng dẫn bài tập
- Import
coltừpyspark.sql.functions, và xem bộ dữ liệuratingsbằng.show(). - Áp dụng phương thức
.filter()lên bộ dữ liệuratingsvới bộ lọc sau trong dấu ngoặc để chỉ lấy cácuserIdnhỏ hơn 100:col("userId") < 100. - Gọi phương thức
.groupBy()trên bộ dữ liệuratingsđể nhóm dữ liệu theouserId. Sau đó gọi.count()để xem mỗiuserIdđã đánh giá bao nhiêu phim.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import the requisite packages
from pyspark.sql.____ import ____
# View the ratings dataset
____.____()
# Filter to show only userIds less than 100
ratings.____(col("____") < ____).____()
# Group data by userId, count ratings
ratings.____("____").count().show()