Bắt đầu ngayBắt đầu miễn phí

Huấn luyện mô hình và dự đoán

Sau khi tách dữ liệu thành tập huấn luyện và tập kiểm tra, ở phần hai của bài tập này, bạn sẽ huấn luyện thuật toán ALS bằng dữ liệu huấn luyện. Thuật toán ALS của PySpark MLlib có các tham số bắt buộc sau — rank (số nhân tố ẩn trong mô hình) và iterations (số vòng lặp chạy). Sau khi huấn luyện mô hình ALS, bạn có thể dùng mô hình để dự đoán các đánh giá từ dữ liệu kiểm tra. Để làm điều này, bạn sẽ cung cấp các cột user và item từ tập kiểm tra và cuối cùng trả về danh sách 2 hàng từ đầu ra của predictAll().

Lưu ý, bạn đã có SparkContext sc, training_datatest_data sẵn trong không gian làm việc.

Bài tập này là một phần của khóa học

Nền tảng Big Data với PySpark

Xem khóa học

Hướng dẫn bài tập

  • Huấn luyện thuật toán ALS với dữ liệu huấn luyện và các tham số cấu hình (rank = 10 và iterations = 10).
  • Bỏ cột rating trong dữ liệu kiểm tra, đây là cột thứ ba.
  • Kiểm tra mô hình bằng cách dự đoán rating từ dữ liệu kiểm tra.
  • Trả về danh sách hai hàng của các giá trị dự đoán.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Create the ALS model on the training data
model = ALS.____(____, rank=10, iterations=10)

# Drop the ratings column 
testdata_no_rating = test_data.___(lambda p: (p[0], ____))

# Predict the model  
predictions = model.____(testdata_no_rating)

# Return the first 2 rows of the RDD
predictions.____(2)
Chỉnh sửa và Chạy Mã