Trénování modelu a predikce
Po rozdělení dat na trénovací a testovací část v druhé části cvičení natrénuješ algoritmus ALS na trénovacích datech. Algoritmus ALS v PySpark MLlib vyžaduje dva povinné parametry – rank (počet latentních faktorů v modelu) a iterations (počet iterací). Po natrénování modelu ALS ho můžeš použít k predikci hodnocení z testovacích dat. K tomu použiješ sloupce s uživateli a položkami z testovací datové sady a nakonec vrátíš seznam 2 řádků výstupu funkce predictAll().
Nezapomeň, že SparkContext sc, training_data i test_data jsou v tvém workspace už k dispozici.
Toto cvičení je součástí kurzu
Big Data Fundamentals with PySpark
Pokyny k cvičení
- Natrénuj algoritmus ALS na trénovacích datech s nastavenými parametry (
rank= 10 aiterations= 10). - Z testovacích dat odstraň sloupec
rating, který je třetím sloupcem. - Otestuj model predikcí hodnocení z testovacích dat.
- Vrať seznam dvou řádků s predikovanými hodnoceními.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create the ALS model on the training data
model = ALS.____(____, rank=10, iterations=10)
# Drop the ratings column
testdata_no_rating = test_data.___(lambda p: (p[0], ____))
# Predict the model
predictions = model.____(testdata_no_rating)
# Return the first 2 rows of the RDD
predictions.____(2)