使用 Apriori 识别频繁项集
您为该线上零售商完成的聚合练习很有帮助。它为了解哪些类别在交易中经常出现提供了起点。现在,零售商希望进一步查看具体商品本身,找出哪些是频繁出现的。
在本练习中,您将不做聚合,直接对线上零售数据集应用 Apriori 算法。您的目标是通过设置最小支持度和最大项数阈值来剪枝项集。请注意,pandas 已以 pd 导入,独热编码后的数据已存为 onehot。
本练习是课程的一部分
Python 中的购物篮分析
练习说明
- 将
onehot传入 Apriori 算法。 - 将最小支持度设置为 0.006。
- 将最大项集长度设置为 3。
- 打印前 5 个项集的预览。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import apriori from mlxtend
from mlxtend.frequent_patterns import apriori
# Compute frequent itemsets using the Apriori algorithm
frequent_itemsets = apriori(____,
____ = ____,
max_len = ____,
use_colnames = True)
# Print a preview of the frequent itemsets
print(____.head())