Prořezávání pomocí bodových grafů
Po zhlédnutí tvého návrhu streamovací služby zaměřené na Batmana z předchozího cvičení si zakladatelka uvědomila, že její původní plán byl možná příliš úzce zaměřený. Místo konkrétních titulů tě teď žádá, abys odhalil/a obecné vzory v asociačních pravidlech a podle toho provedl/a prořezávání. Cílem je identifikovat velkou sadu silných asociací.
Naštěstí ses právě naučil/a generovat bodové grafy. Rozhodneš se začít vykreslením podpory (support) a spolehlivosti (confidence), protože optimální pravidla podle mnoha běžných metrik leží na hranici confidence–support. Data zakódovaná metodou one-hot encoding jsou již naimportována a dostupná jako onehot. Funkce apriori() a association_rules() jsou také naimportovány a pandas je dostupný jako pd.
Toto cvičení je součástí kurzu
Market Basket Analysis v Pythonu
Pokyny k cvičení
- Vygeneruj velké množství itemsetů o 2 položkách tak, že minimální podporu nastavíš na 0.0075 a maximální délku na 2.
- Doplň volání funkce
association_rules()tak, aby nedocházelo k žádnému dalšímu filtrování. - Doplň kód pro vygenerování bodového grafu a nastav proměnnou
ynaconfidence.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import seaborn under its standard alias
import seaborn as sns
# Apply the Apriori algorithm with a support value of 0.0075
frequent_itemsets = apriori(onehot, min_support = ___,
use_colnames = True, max_len = ____)
# Generate association rules without performing additional pruning
rules = association_rules(____, metric = 'support',
min_threshold = ____)
# Generate scatterplot using support and confidence
sns.scatterplot(x = "support", y = "____", data = ____)
plt.show()