Tvorba příznaků
Teď máš vše, co potřebuješ k tomu, aby ses pustil/a do tvorby příznaků na úrovni zákazníka – recency, frekvence, peněžní hodnota a další – pro svůj regresní model. Feature engineering je nejdůležitějším krokem celého procesu strojového učení. V tomto cvičení vytvoříš pět příznaků na úrovni zákazníka, které pak použiješ k predikci transakcí zákazníků v příštím měsíci. Tyto příznaky zachycují vysoce prediktivní vzorce chování zákazníků.
Knihovny pandas a numpy jsou načteny jako pd a np. Dataset online_X je už naimportovaný. Objekt datetime s názvem NOW reprezentující referenční datum pro výpočet recency je také připravený.
Toto cvičení je součástí kurzu
Machine Learning for Marketing in Python
Pokyny k cvičení
- Vypočítej recency odečtením aktuálního data od nejnovějšího
InvoiceDate. - Vypočítej frekvenci spočítáním unikátního počtu faktur.
- Vypočítej peněžní hodnotu součtem všech hodnot výdajů.
- Vypočítej průměrné a celkové množství.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Define the snapshot date
NOW = dt.datetime(2011,11,1)
# Calculate recency by subtracting current date from the latest InvoiceDate
features = online_X.___('CustomerID').agg({
'InvoiceDate': lambda x: (NOW - x.max()).days,
# Calculate frequency by counting unique number of invoices
'InvoiceNo': pd.Series.___,
# Calculate monetary value by summing all spend values
'TotalSum': np.___,
# Calculate average and total quantity
'Quantity': ['___', 'sum']}).reset_index()
# Rename the columns
features.columns = ['CustomerID', 'recency', 'frequency', 'monetary', 'quantity_avg', 'quantity_total']