始める無料で始める

アイテムセットのサポートを可視化する

あるコンテンツ配信系スタートアップからコンサルティングの依頼がありました。ライセンス料を抑えるために、同じ視聴者層に強く訴求する映画だけを集めた、狭めのライブラリを作りたいと考えています。業界の大手と比べて作品数は少なくなりますが、その分、低価格のサブスクリプションを提供できる見込みです。

このプロジェクトでは、MovieLens データとヒートマップを使うことにしました。シンプルにサポートに基づくヒートマップを使えば、他のタイトルと一緒に選ばれやすい(サポートが高い)個々のタイトルを見つけられます。ワンホットエンコード済みのデータは DataFrame onehot として用意されています。さらに、pandaspdseabornsns として利用可能で、apriori()association_rules() はすでにインポート済みです。

この演習はコースの一部です

Python で学ぶマーケットバスケット分析

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Compute frequent itemsets using a minimum support of 0.07
frequent_itemsets = apriori(onehot, min_support = ____, 
                            use_colnames = True, max_len = 2)

# Compute the association rules
rules = association_rules(____, metric = 'support', 
                          min_threshold = 0.0)
コードを編集して実行