Modellträning och prediktioner
Efter att ha delat upp data i tränings- och testdata ska du i övningens andra del träna ALS-algoritmen med träningsdatan. PySpark MLlibs ALS-algoritm har följande obligatoriska parametrar: rank (antalet latenta faktorer i modellen) och iterations (antalet iterationer att köra). När ALS-modellen är tränad kan du använda den för att predicera betyg från testdatan. För detta anger du kolumnerna för användare och objekt från testdatamängden och returnerar slutligen en lista med 2 rader från predictAll()-utdatan.
Kom ihåg att SparkContext sc, training_data och test_data redan finns tillgängliga i din arbetsyta.
Den här övningen är en del av kursen
Grunderna i Big Data med PySpark
Övningsinstruktioner
- Träna ALS-algoritmen med träningsdatan och de konfigurerade parametrarna (
rank= 10 ochiterations= 10). - Ta bort kolumnen
ratingi testdatan, det vill säga den tredje kolumnen. - Testa modellen genom att predicera betyg från testdatan.
- Returnera en lista med två rader av de predicerade betygen.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create the ALS model on the training data
model = ALS.____(____, rank=10, iterations=10)
# Drop the ratings column
testdata_no_rating = test_data.___(lambda p: (p[0], ____))
# Predict the model
predictions = model.____(testdata_no_rating)
# Return the first 2 rows of the RDD
predictions.____(2)