НачатьНачать бесплатно

Обрезка с помощью диаграмм рассеяния

Ознакомившись с вашим предложением по стриминговому сервису на основе фильмов про Бэтмена из предыдущего упражнения, основательница компании понимает, что её первоначальный план был слишком узким. Теперь она просит вас сосредоточиться на общих закономерностях в правилах ассоциации и выполнить обрезку на их основе. Ваша цель — выявить большой набор сильных ассоциаций.

К счастью, вы уже знаете, как строить диаграммы рассеяния. Вы решаете начать с отображения поддержки и достоверности, поскольку оптимальные правила по большинству распространённых метрик расположены на границе достоверности и поддержки. Данные в формате унитарного кодирования уже импортированы и доступны как onehot. Кроме того, импортированы функции apriori() и association_rules(), а библиотека pandas доступна как pd.

Это упражнение является частью курса

Анализ рыночных корзин на Python

Посмотреть курс

Инструкции к упражнению

  • Сгенерируйте большое количество наборов элементов длиной 2, установив минимальную поддержку равной 0,0075 и максимальную длину равной 2.
  • Заполните вызов функции association_rules() так, чтобы дополнительная фильтрация не применялась.
  • Заполните оператор для построения диаграммы рассеяния, задав переменную y равной confidence.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import seaborn under its standard alias
import seaborn as sns

# Apply the Apriori algorithm with a support value of 0.0075
frequent_itemsets = apriori(onehot, min_support = ___, 
                            use_colnames = True, max_len = ____)

# Generate association rules without performing additional pruning
rules = association_rules(____, metric = 'support', 
                          min_threshold = ____)

# Generate scatterplot using support and confidence
sns.scatterplot(x = "support", y = "____", data = ____)
plt.show()
Редактировать и запускать код