Lognormalisering
Standardisering är viktigt för att säkerställa att alla särdrag är jämförbara. Lognormalisering är en vanlig standardiseringsmetod. Du ska kontrollera variansen för utvalda särdrag och beräkna den totala medianvariansen bland särdragen. Särdragen är de numeriska kolumnerna, förutom click, banner_pos, device_type samt kolumnerna search_engine_type, product_type och advertiser_type från förra lektionen – dessa är egentligen kategoriska kolumner. Sedan ska du tillämpa lognormalisering på de kolumner vars varians överstiger medianvariansen och granska resultaten.
Pandas-modulen är tillgänglig som pd i din miljö och exempeldataramen är inläst som df.
Den här övningen är en del av kursen
Förutsäga CTR med maskininlärning i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Select numeric columns and print variance
num_df = df.____(include=['int', 'float'])
filter_cols = ['click', 'banner_pos', 'device_type',
'search_engine_type', 'product_type', 'advertiser_type']
new_df = num_df[num_df.columns[~num_df.columns.____(filter_cols)]]
median = new_df.____.____
print(median)