Обучение модели и предсказания
После разбивки данных на обучающую и тестовую выборки во второй части упражнения вы обучите алгоритм ALS на обучающих данных. Алгоритм ALS в PySpark MLlib имеет следующие обязательные параметры: rank (количество скрытых факторов в модели) и iterations (количество итераций). После обучения модели ALS вы сможете использовать её для предсказания оценок на тестовых данных. Для этого вы передадите столбцы пользователей и элементов из тестового набора данных и вернёте список из 2 строк результата predictAll().
Напоминаем: SparkContext sc, а также training_data и test_data уже доступны в вашем рабочем пространстве.
Это упражнение является частью курса
Основы Big Data с PySpark
Инструкции к упражнению
- Обучите алгоритм ALS на обучающих данных с заданными параметрами (
rank= 10 иiterations= 10). - Удалите столбец
ratingиз тестовых данных — он является третьим столбцом. - Протестируйте модель, предсказав оценки на тестовых данных.
- Верните список из двух строк с предсказанными оценками.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create the ALS model on the training data
model = ALS.____(____, rank=10, iterations=10)
# Drop the ratings column
testdata_no_rating = test_data.___(lambda p: (p[0], ____))
# Predict the model
predictions = model.____(testdata_no_rating)
# Return the first 2 rows of the RDD
predictions.____(2)