CommencezCommencez gratuitement

Entraînement du modèle et prédictions

Après avoir séparé les données en ensembles d'entraînement et de test, dans la deuxième partie de l'exercice, vous allez entraîner l'algorithme ALS avec les données d'entraînement. L'algorithme ALS de PySpark MLlib comporte les paramètres obligatoires suivants : rank (le nombre de facteurs latents dans le modèle) et iterations (le nombre d'itérations à exécuter). Une fois le modèle ALS entraîné, vous pouvez l'utiliser pour prédire les cotes à partir des données de test. Pour cela, vous fournirez les colonnes utilisateur et article de l'ensemble de test et retournerez enfin la liste de 2 lignes de la sortie de predictAll().

Rappel : vous avez déjà SparkContext sc, ainsi que training_data et test_data dans votre espace de travail.

Cette activité fait partie du cours

Principes de Big Data avec PySpark

Voir le cours

Instructions de l’exercice

  • Entraîner l'algorithme ALS avec les données d'entraînement et les paramètres configurés (rank = 10 et iterations = 10).
  • Supprimer la colonne rating dans les données de test, qui est la troisième colonne.
  • Tester le modèle en prédisant la cote à partir des données de test.
  • Retourner une liste de deux lignes des cotes prédites.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create the ALS model on the training data
model = ALS.____(____, rank=10, iterations=10)

# Drop the ratings column 
testdata_no_rating = test_data.___(lambda p: (p[0], ____))

# Predict the model  
predictions = model.____(testdata_no_rating)

# Return the first 2 rows of the RDD
predictions.____(2)
Modifier et exécuter le code