ПочатиПочніть безкоштовно

Навчання моделі та передбачення

Після поділу даних на тренувальні та тестові у другій частині вправи ви навчите алгоритм ALS на тренувальних даних. Алгоритм ALS з PySpark MLlib має такі обов'язкові параметри — rank (кількість прихованих факторів у моделі) та iterations (кількість ітерацій для виконання). Після навчання моделі ALS ви можете використати її, щоб передбачити рейтинги з тестових даних. Для цього ви передасте стовпці користувача та елемента з тестового набору даних і зрештою повернете список із 2 рядків виводу predictAll().

Пам'ятайте, що у вас уже є SparkContext sc, а training_data і test_data доступні у вашому робочому середовищі.

Ця вправа є частиною курсу

Основи Big Data з PySpark

Переглянути курс

Інструкції до вправи

  • Навчіть алгоритм ALS на тренувальних даних із заданими параметрами (rank = 10 та iterations = 10).
  • Приберіть стовпець rating у тестових даних — це третій стовпець.
  • Перевірте модель, передбачивши рейтинг для тестових даних.
  • Поверніть список із двох рядків передбачених рейтингів.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Create the ALS model on the training data
model = ALS.____(____, rank=10, iterations=10)

# Drop the ratings column 
testdata_no_rating = test_data.___(lambda p: (p[0], ____))

# Predict the model  
predictions = model.____(testdata_no_rating)

# Return the first 2 rows of the RDD
predictions.____(2)
Редагувати та запускати код