Začněte nyníZačněte zdarma

Trénování modelu a predikce

Po rozdělení dat na trénovací a testovací část v druhé části cvičení natrénuješ algoritmus ALS na trénovacích datech. Algoritmus ALS v PySpark MLlib vyžaduje dva povinné parametry – rank (počet latentních faktorů v modelu) a iterations (počet iterací). Po natrénování modelu ALS ho můžeš použít k predikci hodnocení z testovacích dat. K tomu použiješ sloupce s uživateli a položkami z testovací datové sady a nakonec vrátíš seznam 2 řádků výstupu funkce predictAll().

Nezapomeň, že SparkContext sc, training_data i test_data jsou v tvém workspace už k dispozici.

Toto cvičení je součástí kurzu

Big Data Fundamentals with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Natrénuj algoritmus ALS na trénovacích datech s nastavenými parametry (rank = 10 a iterations = 10).
  • Z testovacích dat odstraň sloupec rating, který je třetím sloupcem.
  • Otestuj model predikcí hodnocení z testovacích dat.
  • Vrať seznam dvou řádků s predikovanými hodnoceními.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create the ALS model on the training data
model = ALS.____(____, rank=10, iterations=10)

# Drop the ratings column 
testdata_no_rating = test_data.___(lambda p: (p[0], ____))

# Predict the model  
predictions = model.____(testdata_no_rating)

# Return the first 2 rows of the RDD
predictions.____(2)
Upravit a spustit kód