Optimalidad de la frontera soporte-confianza
Vuelves con la fundadora y le enseñas el diagrama de dispersión del ejercicio anterior. Le preguntas si quiere que apliques poda para recuperar la frontera soporte-confianza. Le hablas del resultado de Bayardo-Agrawal, pero se muestra escéptica y te pide que lo demuestres con un ejemplo.
Como los diagramas de dispersión pueden escalar el tamaño de los puntos según una tercera métrica, decides aprovecharlo para demostrar la optimalidad de la frontera soporte-confianza. Lo mostrarás escalando el tamaño de los puntos con la métrica de lift, una de las métricas a las que se aplica Bayardo-Agrawal. Los datos con one-hot encoding ya se han importado para ti y están disponibles como onehot. Además, apriori() y association_rules() ya se han importado y pandas está disponible como pd.
Este ejercicio forma parte del curso
Análisis de cesta de la compra en Python
Instrucciones del ejercicio
- Aplica el algoritmo Apriori al DataFrame
onehot. - Calcula las reglas de asociación usando la métrica
supporty un umbral mínimo de 0.0. - Completa la expresión del diagrama de dispersión para que el tamaño de los puntos se escale con
lift.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Import seaborn under its standard alias
import seaborn as sns
# Apply the Apriori algorithm with a support value of 0.0075
frequent_itemsets = ____(____, min_support = 0.0075,
use_colnames = True, max_len = 2)
# Generate association rules without performing additional pruning
rules = ____(frequent_itemsets, metric = "support",
min_threshold = ____)
# Generate scatterplot using support and confidence
sns.scatterplot(x = "support", y = "confidence",
size = "____", data = rules)
plt.show()