分解中的信息损失
您也许会疑惑:列数远少于原始数据的因子,如何在不丢失信息的情况下概括更大的 DataFrame?事实上并不能——我们得到的因子通常只是对数据的近似,因为不可避免会有部分信息丢失。这意味着预测值可能不精确,但应当足够接近,具有实际参考价值。
在本练习中,您将查看与上一个练习相同的分解前的原始 DataFrame,已加载为 original_df,并将其与两个因子的乘积进行比较,即 user_matrix 和 item_matrix。
本练习是课程的一部分
用 Python 构建推荐引擎
练习说明
- 计算
user_matrix与item_matrix的点积,并将结果保存为predictions_df。
交互式实操练习
通过完成这段示例代码来试试这个练习。
import numpy as np
# Multiply the user and item matrices
predictions_df = ____.____(____, ____)
# Inspect the recreated DataFrame
print(predictions_df)
# Inspect the original DataFrame and compare
print(original_df)