Kom igångKom igång gratis

Lognormalisering

Standardisering är viktigt för att säkerställa att alla särdrag är jämförbara. Lognormalisering är en vanlig standardiseringsmetod. Du ska kontrollera variansen för utvalda särdrag och beräkna den totala medianvariansen bland särdragen. Särdragen är de numeriska kolumnerna, förutom click, banner_pos, device_type samt kolumnerna search_engine_type, product_type och advertiser_type från förra lektionen – dessa är egentligen kategoriska kolumner. Sedan ska du tillämpa lognormalisering på de kolumner vars varians överstiger medianvariansen och granska resultaten.

Pandas-modulen är tillgänglig som pd i din miljö och exempeldataramen är inläst som df.

Den här övningen är en del av kursen

Förutsäga CTR med maskininlärning i Python

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Select numeric columns and print variance
num_df = df.____(include=['int', 'float'])
filter_cols = ['click', 'banner_pos', 'device_type',
               'search_engine_type', 'product_type', 'advertiser_type']
new_df = num_df[num_df.columns[~num_df.columns.____(filter_cols)]]
median = new_df.____.____
print(median)
Redigera och kör kod