Zacznij terazZacznij za darmo

Trenowanie modelu i przewidywanie wyników

Po podzieleniu danych na zbiór treningowy i testowy w drugiej części ćwiczenia wytrenuj algorytm ALS na danych treningowych. Algorytm ALS w PySpark MLlib wymaga dwóch obowiązkowych parametrów: rank (liczba ukrytych czynników w modelu) oraz iterations (liczba iteracji). Po wytrenowaniu modelu ALS możesz go użyć do przewidywania ocen na podstawie danych testowych. W tym celu podaj kolumny użytkownika i elementu ze zbioru testowego, a następnie zwróć listę 2 wierszy z wynikiem predictAll().

Pamiętaj: SparkContext sc, training_data oraz test_data są już dostępne w twoim środowisku pracy.

To ćwiczenie jest częścią kursu

Podstawy Big Data z PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Wytrenuj algorytm ALS na danych treningowych z użyciem skonfigurowanych parametrów (rank = 10 i iterations = 10).
  • Usuń kolumnę rating z danych testowych – jest to trzecia kolumna.
  • Przetestuj model, przewidując oceny na podstawie danych testowych.
  • Zwróć listę dwóch wierszy z przewidywanymi ocenami.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Create the ALS model on the training data
model = ALS.____(____, rank=10, iterations=10)

# Drop the ratings column 
testdata_no_rating = test_data.___(lambda p: (p[0], ____))

# Predict the model  
predictions = model.____(testdata_no_rating)

# Return the first 2 rows of the RDD
predictions.____(2)
Edytuj i uruchom kod