НачатьНачать бесплатно

Оптимальность границы поддержки и достоверности

Вы возвращаетесь к основателю компании с диаграммой рассеяния, построенной в предыдущем упражнении, и спрашиваете, стоит ли применить отсечение для восстановления границы поддержки и достоверности. Вы рассказываете ей о результате Байардо–Агравала, однако она настроена скептически и просит продемонстрировать это на конкретном примере.

Вспомнив, что диаграммы рассеяния позволяют масштабировать размер точек по третьей метрике, вы решаете воспользоваться этим для демонстрации оптимальности границы поддержки и достоверности. Для этого вы масштабируете размер точек с помощью метрики lift — одной из метрик, к которым применим результат Байардо–Агравала. Данные в формате горячего кодирования уже импортированы и доступны как onehot. Также импортированы apriori() и association_rules(), а pandas доступен как pd.

Это упражнение является частью курса

Анализ рыночных корзин на Python

Посмотреть курс

Инструкции к упражнению

  • Примените алгоритм Apriori к DataFrame onehot.
  • Вычислите правила ассоциации, используя метрику support и минимальный порог 0,0.
  • Завершите выражение для диаграммы рассеяния так, чтобы размер точек масштабировался по lift.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import seaborn under its standard alias
import seaborn as sns

# Apply the Apriori algorithm with a support value of 0.0075
frequent_itemsets = ____(____, min_support = 0.0075, 
                         use_colnames = True, max_len = 2)

# Generate association rules without performing additional pruning
rules = ____(frequent_itemsets, metric = "support", 
                          min_threshold = ____)

# Generate scatterplot using support and confidence
sns.scatterplot(x = "support", y = "confidence", 
                size = "____", data = rules)
plt.show()
Редактировать и запускать код