Оптимальность границы поддержки и достоверности
Вы возвращаетесь к основателю компании с диаграммой рассеяния, построенной в предыдущем упражнении, и спрашиваете, стоит ли применить отсечение для восстановления границы поддержки и достоверности. Вы рассказываете ей о результате Байардо–Агравала, однако она настроена скептически и просит продемонстрировать это на конкретном примере.
Вспомнив, что диаграммы рассеяния позволяют масштабировать размер точек по третьей метрике, вы решаете воспользоваться этим для демонстрации оптимальности границы поддержки и достоверности. Для этого вы масштабируете размер точек с помощью метрики lift — одной из метрик, к которым применим результат Байардо–Агравала. Данные в формате горячего кодирования уже импортированы и доступны как onehot. Также импортированы apriori() и association_rules(), а pandas доступен как pd.
Это упражнение является частью курса
Анализ рыночных корзин на Python
Инструкции к упражнению
- Примените алгоритм Apriori к DataFrame
onehot. - Вычислите правила ассоциации, используя метрику
supportи минимальный порог 0,0. - Завершите выражение для диаграммы рассеяния так, чтобы размер точек масштабировался по
lift.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import seaborn under its standard alias
import seaborn as sns
# Apply the Apriori algorithm with a support value of 0.0075
frequent_itemsets = ____(____, min_support = 0.0075,
use_colnames = True, max_len = 2)
# Generate association rules without performing additional pruning
rules = ____(frequent_itemsets, metric = "support",
min_threshold = ____)
# Generate scatterplot using support and confidence
sns.scatterplot(x = "support", y = "confidence",
size = "____", data = rules)
plt.show()