Antrenarea modelului și predicții
După împărțirea datelor în seturi de antrenament și de testare, în a doua parte a exercițiului vei antrena algoritmul ALS folosind datele de antrenament. Algoritmul ALS din PySpark MLlib are următorii parametri obligatorii: rank (numărul de factori latenți din model) și iterations (numărul de iterații de rulat). După antrenarea modelului ALS, îl poți folosi pentru a prezice evaluările din datele de testare. În acest scop, vei furniza coloanele de utilizator și de element din setul de testare și vei returna în final lista cu 2 rânduri din rezultatul predictAll().
Reține că SparkContext-ul sc, training_data și test_data sunt deja disponibile în spațiul tău de lucru.
Acest exercițiu face parte din cursul
Fundamentele Big Data cu PySpark
Instrucțiuni pentru exercițiu
- Antrenează algoritmul ALS cu datele de antrenament și parametrii configurați (
rank= 10 șiiterations= 10). - Elimină coloana
ratingdin datele de testare, care este a treia coloană. - Testează modelul prezicând evaluările din datele de testare.
- Returnează o listă cu două rânduri ale evaluărilor prezise.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create the ALS model on the training data
model = ALS.____(____, rank=10, iterations=10)
# Drop the ratings column
testdata_no_rating = test_data.___(lambda p: (p[0], ____))
# Predict the model
predictions = model.____(testdata_no_rating)
# Return the first 2 rows of the RDD
predictions.____(2)