Trenowanie modelu i przewidywanie wyników
Po podzieleniu danych na zbiór treningowy i testowy w drugiej części ćwiczenia wytrenuj algorytm ALS na danych treningowych. Algorytm ALS w PySpark MLlib wymaga dwóch obowiązkowych parametrów: rank (liczba ukrytych czynników w modelu) oraz iterations (liczba iteracji). Po wytrenowaniu modelu ALS możesz go użyć do przewidywania ocen na podstawie danych testowych. W tym celu podaj kolumny użytkownika i elementu ze zbioru testowego, a następnie zwróć listę 2 wierszy z wynikiem predictAll().
Pamiętaj: SparkContext sc, training_data oraz test_data są już dostępne w twoim środowisku pracy.
To ćwiczenie jest częścią kursu
Podstawy Big Data z PySpark
Instrukcje do ćwiczenia
- Wytrenuj algorytm ALS na danych treningowych z użyciem skonfigurowanych parametrów (
rank= 10 iiterations= 10). - Usuń kolumnę
ratingz danych testowych – jest to trzecia kolumna. - Przetestuj model, przewidując oceny na podstawie danych testowych.
- Zwróć listę dwóch wierszy z przewidywanymi ocenami.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create the ALS model on the training data
model = ALS.____(____, rank=10, iterations=10)
# Drop the ratings column
testdata_no_rating = test_data.___(lambda p: (p[0], ____))
# Predict the model
predictions = model.____(testdata_no_rating)
# Return the first 2 rows of the RDD
predictions.____(2)