Kom igångKom igång gratis

Modellträning och prediktioner

Efter att ha delat upp data i tränings- och testdata ska du i övningens andra del träna ALS-algoritmen med träningsdatan. PySpark MLlibs ALS-algoritm har följande obligatoriska parametrar: rank (antalet latenta faktorer i modellen) och iterations (antalet iterationer att köra). När ALS-modellen är tränad kan du använda den för att predicera betyg från testdatan. För detta anger du kolumnerna för användare och objekt från testdatamängden och returnerar slutligen en lista med 2 rader från predictAll()-utdatan.

Kom ihåg att SparkContext sc, training_data och test_data redan finns tillgängliga i din arbetsyta.

Den här övningen är en del av kursen

Grunderna i Big Data med PySpark

Visa kurs

Övningsinstruktioner

  • Träna ALS-algoritmen med träningsdatan och de konfigurerade parametrarna (rank = 10 och iterations = 10).
  • Ta bort kolumnen rating i testdatan, det vill säga den tredje kolumnen.
  • Testa modellen genom att predicera betyg från testdatan.
  • Returnera en lista med två rader av de predicerade betygen.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Create the ALS model on the training data
model = ALS.____(____, rank=10, iterations=10)

# Drop the ratings column 
testdata_no_rating = test_data.___(lambda p: (p[0], ____))

# Predict the model  
predictions = model.____(testdata_no_rating)

# Return the first 2 rows of the RDD
predictions.____(2)
Redigera och kör kod