ÎncepețiÎncepe gratuit

Antrenarea modelului și predicții

După împărțirea datelor în seturi de antrenament și de testare, în a doua parte a exercițiului vei antrena algoritmul ALS folosind datele de antrenament. Algoritmul ALS din PySpark MLlib are următorii parametri obligatorii: rank (numărul de factori latenți din model) și iterations (numărul de iterații de rulat). După antrenarea modelului ALS, îl poți folosi pentru a prezice evaluările din datele de testare. În acest scop, vei furniza coloanele de utilizator și de element din setul de testare și vei returna în final lista cu 2 rânduri din rezultatul predictAll().

Reține că SparkContext-ul sc, training_data și test_data sunt deja disponibile în spațiul tău de lucru.

Acest exercițiu face parte din cursul

Fundamentele Big Data cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Antrenează algoritmul ALS cu datele de antrenament și parametrii configurați (rank = 10 și iterations = 10).
  • Elimină coloana rating din datele de testare, care este a treia coloană.
  • Testează modelul prezicând evaluările din datele de testare.
  • Returnează o listă cu două rânduri ale evaluărilor prezise.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create the ALS model on the training data
model = ALS.____(____, rank=10, iterations=10)

# Drop the ratings column 
testdata_no_rating = test_data.___(lambda p: (p[0], ____))

# Predict the model  
predictions = model.____(testdata_no_rating)

# Return the first 2 rows of the RDD
predictions.____(2)
Editează și rulează codul