Huấn luyện mô hình và dự đoán
Sau khi tách dữ liệu thành tập huấn luyện và tập kiểm tra, ở phần hai của bài tập này, bạn sẽ huấn luyện thuật toán ALS bằng dữ liệu huấn luyện. Thuật toán ALS của PySpark MLlib có các tham số bắt buộc sau — rank (số nhân tố ẩn trong mô hình) và iterations (số vòng lặp chạy). Sau khi huấn luyện mô hình ALS, bạn có thể dùng mô hình để dự đoán các đánh giá từ dữ liệu kiểm tra. Để làm điều này, bạn sẽ cung cấp các cột user và item từ tập kiểm tra và cuối cùng trả về danh sách 2 hàng từ đầu ra của predictAll().
Lưu ý, bạn đã có SparkContext sc, training_data và test_data sẵn trong không gian làm việc.
Bài tập này là một phần của khóa học
Nền tảng Big Data với PySpark
Hướng dẫn bài tập
- Huấn luyện thuật toán ALS với dữ liệu huấn luyện và các tham số cấu hình (
rank= 10 vàiterations= 10). - Bỏ cột
ratingtrong dữ liệu kiểm tra, đây là cột thứ ba. - Kiểm tra mô hình bằng cách dự đoán rating từ dữ liệu kiểm tra.
- Trả về danh sách hai hàng của các giá trị dự đoán.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create the ALS model on the training data
model = ALS.____(____, rank=10, iterations=10)
# Drop the ratings column
testdata_no_rating = test_data.___(lambda p: (p[0], ____))
# Predict the model
predictions = model.____(testdata_no_rating)
# Return the first 2 rows of the RDD
predictions.____(2)