Entraînement du modèle et prédictions
Après avoir séparé les données en ensembles d'entraînement et de test, dans la deuxième partie de l'exercice, vous allez entraîner l'algorithme ALS avec les données d'entraînement. L'algorithme ALS de PySpark MLlib comporte les paramètres obligatoires suivants : rank (le nombre de facteurs latents dans le modèle) et iterations (le nombre d'itérations à exécuter). Une fois le modèle ALS entraîné, vous pouvez l'utiliser pour prédire les cotes à partir des données de test. Pour cela, vous fournirez les colonnes utilisateur et article de l'ensemble de test et retournerez enfin la liste de 2 lignes de la sortie de predictAll().
Rappel : vous avez déjà SparkContext sc, ainsi que training_data et test_data dans votre espace de travail.
Cette activité fait partie du cours
Principes de Big Data avec PySpark
Instructions de l’exercice
- Entraîner l'algorithme ALS avec les données d'entraînement et les paramètres configurés (
rank= 10 etiterations= 10). - Supprimer la colonne
ratingdans les données de test, qui est la troisième colonne. - Tester le modèle en prédisant la cote à partir des données de test.
- Retourner une liste de deux lignes des cotes prédites.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create the ALS model on the training data
model = ALS.____(____, rank=10, iterations=10)
# Drop the ratings column
testdata_no_rating = test_data.___(lambda p: (p[0], ____))
# Predict the model
predictions = model.____(testdata_no_rating)
# Return the first 2 rows of the RDD
predictions.____(2)