मॉडल प्रशिक्षण और प्रेडिक्शन
डेटा को training और test हिस्सों में बाँटने के बाद, अभ्यास के दूसरे भाग में आप training डेटा का उपयोग करके ALS एल्गोरिदम को ट्रेन करेंगे. PySpark MLlib के ALS एल्गोरिदम में ये अनिवार्य पैरामीटर होते हैं - rank (मॉडल में latent factors की संख्या) और iterations (चलने वाली iterations की संख्या). ALS मॉडल को ट्रेन करने के बाद, आप इसे test डेटा से ratings प्रेडिक्ट करने में उपयोग कर सकते हैं. इसके लिए, आप test डेटासेट से user और item कॉलम देंगे और अंत में predictAll() के आउटपुट की 2 पंक्तियों की सूची लौटाएँगे.
ध्यान रखें, आपके वर्कस्पेस में SparkContext sc, training_data और test_data पहले से उपलब्ध हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Big Data Fundamentals
अभ्यास निर्देश
- training डेटा और कॉन्फ़िगर किए गए पैरामीटर (
rank= 10 औरiterations= 10) के साथ ALS एल्गोरिदम को ट्रेन करें. - test डेटा में तीसरा कॉलम
ratingड्रॉप करें. - test डेटा से rating प्रेडिक्ट करके मॉडल का परीक्षण करें.
- प्रेडिक्ट की गई ratings की दो पंक्तियों की सूची लौटाएँ.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Create the ALS model on the training data
model = ALS.____(____, rank=10, iterations=10)
# Drop the ratings column
testdata_no_rating = test_data.___(lambda p: (p[0], ____))
# Predict the model
predictions = model.____(testdata_no_rating)
# Return the first 2 rows of the RDD
predictions.____(2)