Kom igångKom igång gratis

Skapa nya särdrag

Feature engineering innebär även att faktiskt skapa nya särdrag. Det är viktigt eftersom modellen förlitar sig på dessa särdrag för att göra korrekta förutsägelser. I den här övningen undersöker du egenskaperna hos tre kolumner som visas som heltal i datan men representerar kategoriska värden. De tre kolumnerna är: search_engine_type, product_type och advertiser_type. Du skapar räknesärdrag för dessa 3 kolumner samt för device_id och site_id. Räknesärdraget representerar antalet klick för var och en av dessa kolumner och används senare för förutsägelse.

Pandas-modulen finns tillgänglig som pd i din arbetsyta och exempelns DataFrame är inläst som df.

Den här övningen är en del av kursen

Förutsäga CTR med maskininlärning i Python

Visa kurs

Övningsinstruktioner

  • Skriv ut det totala antalet värden och antalet unika värden för varje särdrag i listan feature_list.
  • Skapa nya särdrag från särdragen i new_feature_list genom att räkna antalet klick för varje särdrag med hjälp av .transform().

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Get counts of total and unique values for given features
feature_list = ["search_engine_type", "product_type", "advertiser_type"]
for feature in feature_list:
	print(df[feature].____)
	print(df[feature].____)

# Define new features as counts
new_feature_list = ['device_id', 'site_id'] + feature_list
for new_feature in new_feature_list:
  df[new_feature + '_count'] = df.____(
    new_feature)['click'].____("count")
print(df.head(5))
Redigera och kör kod