การฝึกโมเดลและการพยากรณ์
หลังจากแบ่งข้อมูลออกเป็นชุดฝึกและชุดทดสอบแล้ว ในส่วนที่สองของแบบฝึกหัดนี้ จะได้ฝึกอัลกอริทึม ALS โดยใช้ข้อมูลชุดฝึก อัลกอริทึม ALS ของ PySpark MLlib มีพารามิเตอร์บังคับ ได้แก่ rank (จำนวน latent factor ในโมเดล) และ iterations (จำนวนรอบที่รัน) เมื่อฝึกโมเดล ALS เสร็จแล้ว สามารถนำโมเดลไปพยากรณ์คะแนนจากข้อมูลชุดทดสอบได้ โดยระบุคอลัมน์ผู้ใช้และไอเทมจากชุดทดสอบ แล้วคืนค่ารายการ 2 แถวจากผลลัพธ์ของ predictAll()
ทั้งนี้ SparkContext sc, training_data และ test_data พร้อมใช้งานใน workspace ของคุณแล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Big Data Fundamentals with PySpark
คำแนะนำการฝึกหัด
- ฝึกอัลกอริทึม ALS ด้วยข้อมูลชุดฝึกและพารามิเตอร์ที่กำหนด (
rank= 10 และiterations= 10) - ตัดคอลัมน์
ratingออกจากข้อมูลชุดทดสอบ ซึ่งเป็นคอลัมน์ที่ 3 - ทดสอบโมเดลโดยพยากรณ์คะแนนจากข้อมูลชุดทดสอบ
- คืนค่ารายการสองแถวของคะแนนที่พยากรณ์ได้
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create the ALS model on the training data
model = ALS.____(____, rank=10, iterations=10)
# Drop the ratings column
testdata_no_rating = test_data.___(lambda p: (p[0], ____))
# Predict the model
predictions = model.____(testdata_no_rating)
# Return the first 2 rows of the RDD
predictions.____(2)