散布図でのプルーニング
前の演習であなたが提案したバットマン中心のストリーミング施策を見て、創業者は最初の計画がやや狭すぎたと気づきました。初期タイトルに注目するのではなく、アソシエーションルール全体の一般的なパターンに焦点を当て、そのうえでプルーニングを行ってほしいと依頼されます。目標は、強力な関連を多く見つけることです。
幸い、散布図の作成方法を学んだばかりですね。多くの一般的な指標で最適なルールは confidence-support の境界上に位置するため、まずは support と confidence をプロットすることから始めましょう。ワンホットエンコード済みのデータは onehot として読み込まれており使用できます。さらに、apriori() と association_rules() はインポート済みで、pandas は pd として利用できます。
この演習はコースの一部です
Python で学ぶマーケットバスケット分析
演習の手順
- 最小 support を 0.0075、最大長を 2 に設定して、2 アイテムのアイテムセットを大量に生成します。
- 追加のフィルタリングが行われないように、
association_rules()の記述を完成させます。 - 散布図を作成するコードを完成させ、
y変数にはconfidenceを指定します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import seaborn under its standard alias
import seaborn as sns
# Apply the Apriori algorithm with a support value of 0.0075
frequent_itemsets = apriori(onehot, min_support = ___,
use_colnames = True, max_len = ____)
# Generate association rules without performing additional pruning
rules = association_rules(____, metric = 'support',
min_threshold = ____)
# Generate scatterplot using support and confidence
sns.scatterplot(x = "support", y = "____", data = ____)
plt.show()