НачатьНачать бесплатно

Обучение модели и предсказания

После разбивки данных на обучающую и тестовую выборки во второй части упражнения вы обучите алгоритм ALS на обучающих данных. Алгоритм ALS в PySpark MLlib имеет следующие обязательные параметры: rank (количество скрытых факторов в модели) и iterations (количество итераций). После обучения модели ALS вы сможете использовать её для предсказания оценок на тестовых данных. Для этого вы передадите столбцы пользователей и элементов из тестового набора данных и вернёте список из 2 строк результата predictAll().

Напоминаем: SparkContext sc, а также training_data и test_data уже доступны в вашем рабочем пространстве.

Это упражнение является частью курса

Основы Big Data с PySpark

Посмотреть курс

Инструкции к упражнению

  • Обучите алгоритм ALS на обучающих данных с заданными параметрами (rank = 10 и iterations = 10).
  • Удалите столбец rating из тестовых данных — он является третьим столбцом.
  • Протестируйте модель, предсказав оценки на тестовых данных.
  • Верните список из двух строк с предсказанными оценками.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create the ALS model on the training data
model = ALS.____(____, rank=10, iterations=10)

# Drop the ratings column 
testdata_no_rating = test_data.___(lambda p: (p[0], ____))

# Predict the model  
predictions = model.____(testdata_no_rating)

# Return the first 2 rows of the RDD
predictions.____(2)
Редактировать и запускать код