Навчання моделі та передбачення
Після поділу даних на тренувальні та тестові у другій частині вправи ви навчите алгоритм ALS на тренувальних даних. Алгоритм ALS з PySpark MLlib має такі обов'язкові параметри — rank (кількість прихованих факторів у моделі) та iterations (кількість ітерацій для виконання). Після навчання моделі ALS ви можете використати її, щоб передбачити рейтинги з тестових даних. Для цього ви передасте стовпці користувача та елемента з тестового набору даних і зрештою повернете список із 2 рядків виводу predictAll().
Пам'ятайте, що у вас уже є SparkContext sc, а training_data і test_data доступні у вашому робочому середовищі.
Ця вправа є частиною курсу
Основи Big Data з PySpark
Інструкції до вправи
- Навчіть алгоритм ALS на тренувальних даних із заданими параметрами (
rank= 10 таiterations= 10). - Приберіть стовпець
ratingу тестових даних — це третій стовпець. - Перевірте модель, передбачивши рейтинг для тестових даних.
- Поверніть список із двох рядків передбачених рейтингів.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create the ALS model on the training data
model = ALS.____(____, rank=10, iterations=10)
# Drop the ratings column
testdata_no_rating = test_data.___(lambda p: (p[0], ____))
# Predict the model
predictions = model.____(testdata_no_rating)
# Return the first 2 rows of the RDD
predictions.____(2)