Perte d'information lors de la factorisation
Vous vous demandez peut-être comment des facteurs avec beaucoup moins de colonnes peuvent résumer un DataFrame plus grand sans perte. En fait, ce n'est pas le cas : les facteurs que nous créons sont généralement une approximation fidèle des données, puisqu'une certaine perte d'information est inévitable. Cela signifie que les valeurs prédites ne seront pas exactes, mais devraient être suffisamment proches pour être utiles.
Dans cet exercice, vous examinerez le même DataFrame original avant factorisation que dans l'exercice précédent, chargé dans original_df, et vous le comparerez au produit de ses deux facteurs, user_matrix et item_matrix.
Cette activité fait partie du cours
Créer des moteurs de recommandation en Python
Instructions de l’exercice
- Calculez le produit scalaire (produit matriciel) de
user_matrixetitem_matrix, puis enregistrez le résultat danspredictions_df.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
import numpy as np
# Multiply the user and item matrices
predictions_df = ____.____(____, ____)
# Inspect the recreated DataFrame
print(predictions_df)
# Inspect the original DataFrame and compare
print(original_df)