Logaritmická normalizace
Standardizace je důležitá k tomu, aby byly všechny příznaky vzájemně srovnatelné. Logaritmická normalizace je jednou z běžných metod standardizace. Podíváš se na rozptyl vybraných příznaků a vypočítáš celkový mediánový rozptyl. Pracovat budeš s numerickými příznaky – s výjimkou sloupce click, banner_pos, device_type a sloupců search_engine_type, product_type, advertiser_type z předchozí lekce, které jsou ve skutečnosti kategorické. Potom aplikuješ logaritmickou normalizaci na sloupce s rozptylem vyšším než mediánový rozptyl a ověříš výsledky.
Modul pandas je dostupný jako pd a vzorový DataFrame je načtený jako df.
Toto cvičení je součástí kurzu
Předpovídání CTR pomocí Machine Learning v Pythonu
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Select numeric columns and print variance
num_df = df.____(include=['int', 'float'])
filter_cols = ['click', 'banner_pos', 'device_type',
'search_engine_type', 'product_type', 'advertiser_type']
new_df = num_df[num_df.columns[~num_df.columns.____(filter_cols)]]
median = new_df.____.____
print(median)