Kom igångKom igång gratis

Standardskalning

Standardskalning transformerar numeriska särdrag så att de får medelvärdet 0 och variansen 1. I den här övningen utför du standardskalning med hjälp av StandardScaler() från sklearn. Först väljer du ut de relevanta kolumnerna att skala, genom att kombinera filtrering av numeriska kolumner med viss kännedom om kolumnernas innehåll. Denna filtrering är redan förberedd och görs med hjälp av reguljära uttryck, vilket möjliggör delmatchning av strängar. Sedan använder du fit_transform() för att transformera de relevanta kolumnerna.

Pandas-modulen finns tillgänglig som pd i din arbetsmiljö och exempelns DataFrame är inläst som df. Dessutom är kolumnen hour redan konverterad till ett datetime-format, och StandardScaler från sklearn.preprocessing finns tillgänglig.

Den här övningen är en del av kursen

Förutsäga CTR med maskininlärning i Python

Visa kurs

Övningsinstruktioner

  • Välj de numeriska kolumnerna och filtrera de angivna filter_cols med .select_dtypes().
  • Tillämpa standardskalning på de relevanta kolumnerna genom att först skapa en StandardScaler() och sedan använda .fit_transform().
  • Skriv ut variansen för de nyligen transformerade kolumnerna med hjälp av .var().

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Get non-categorical columns, with a filter
num_df = df.____(include=['int', 'float'])
filter_cols = ['click', 'banner_pos', 'device_type',
               'search_engine_type', 'product_type', 'advertiser_type']
new_df = num_df[num_df.columns[~num_df.columns.____(filter_cols)]]
num_cols = new_df.____

# Transform columns using StandardScaler
scaler = ____()
df[num_cols] = scaler.____(df[____])

# Print mean and variance of transformed columns
print(df[num_cols].mean())
print(df[num_cols].____)
Redigera och kör kod