เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การฝึกโมเดลและการพยากรณ์

หลังจากแบ่งข้อมูลออกเป็นชุดฝึกและชุดทดสอบแล้ว ในส่วนที่สองของแบบฝึกหัดนี้ จะได้ฝึกอัลกอริทึม ALS โดยใช้ข้อมูลชุดฝึก อัลกอริทึม ALS ของ PySpark MLlib มีพารามิเตอร์บังคับ ได้แก่ rank (จำนวน latent factor ในโมเดล) และ iterations (จำนวนรอบที่รัน) เมื่อฝึกโมเดล ALS เสร็จแล้ว สามารถนำโมเดลไปพยากรณ์คะแนนจากข้อมูลชุดทดสอบได้ โดยระบุคอลัมน์ผู้ใช้และไอเทมจากชุดทดสอบ แล้วคืนค่ารายการ 2 แถวจากผลลัพธ์ของ predictAll()

ทั้งนี้ SparkContext sc, training_data และ test_data พร้อมใช้งานใน workspace ของคุณแล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Big Data Fundamentals with PySpark

ดูคอร์ส

คำแนะนำการฝึกหัด

  • ฝึกอัลกอริทึม ALS ด้วยข้อมูลชุดฝึกและพารามิเตอร์ที่กำหนด (rank = 10 และ iterations = 10)
  • ตัดคอลัมน์ rating ออกจากข้อมูลชุดทดสอบ ซึ่งเป็นคอลัมน์ที่ 3
  • ทดสอบโมเดลโดยพยากรณ์คะแนนจากข้อมูลชุดทดสอบ
  • คืนค่ารายการสองแถวของคะแนนที่พยากรณ์ได้

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Create the ALS model on the training data
model = ALS.____(____, rank=10, iterations=10)

# Drop the ratings column 
testdata_no_rating = test_data.___(lambda p: (p[0], ____))

# Predict the model  
predictions = model.____(testdata_no_rating)

# Return the first 2 rows of the RDD
predictions.____(2)
แก้ไขและรันโค้ด