Začněte nyníZačněte zdarma

Vytváření nových příznaků

Feature engineering zahrnuje také skutečné vytváření nových příznaků. Je to důležitý krok, protože model se při předpovídání opírá právě o tyto příznaky. V tomto cvičení prozkoumáš vlastnosti tří sloupců, které jsou v datech uloženy jako celá čísla, ale ve skutečnosti představují kategorické hodnoty. Jsou to: search_engine_type, product_type a advertiser_type. Pro těchto 5 sloupců — včetně device_id a site_id — vytvoříš příznaky počtu kliknutí. Ty budou sloužit jako vstupy pro pozdější predikci.

Modul pandas je dostupný jako pd a ukázkový DataFrame je načten jako df.

Toto cvičení je součástí kurzu

Předpovídání CTR pomocí Machine Learning v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Vypiš celkový počet hodnot a počet unikátních hodnot pro každý příznak ze seznamu feature_list.
  • Z příznaků v seznamu new_feature_list vytvoř nové příznaky tak, že pro každý příznak spočítáš počet kliknutí pomocí metody .transform().

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Get counts of total and unique values for given features
feature_list = ["search_engine_type", "product_type", "advertiser_type"]
for feature in feature_list:
	print(df[feature].____)
	print(df[feature].____)

# Define new features as counts
new_feature_list = ['device_id', 'site_id'] + feature_list
for new_feature in new_feature_list:
  df[new_feature + '_count'] = df.____(
    new_feature)['click'].____("count")
print(df.head(5))
Upravit a spustit kód