Skapa nya särdrag
Feature engineering innebär även att faktiskt skapa nya särdrag. Det är viktigt eftersom modellen förlitar sig på dessa särdrag för att göra korrekta förutsägelser. I den här övningen undersöker du egenskaperna hos tre kolumner som visas som heltal i datan men representerar kategoriska värden. De tre kolumnerna är: search_engine_type, product_type och advertiser_type. Du skapar räknesärdrag för dessa 3 kolumner samt för device_id och site_id. Räknesärdraget representerar antalet klick för var och en av dessa kolumner och används senare för förutsägelse.
Pandas-modulen finns tillgänglig som pd i din arbetsyta och exempelns DataFrame är inläst som df.
Den här övningen är en del av kursen
Förutsäga CTR med maskininlärning i Python
Övningsinstruktioner
- Skriv ut det totala antalet värden och antalet unika värden för varje särdrag i listan
feature_list. - Skapa nya särdrag från särdragen i
new_feature_listgenom att räkna antalet klick för varje särdrag med hjälp av.transform().
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Get counts of total and unique values for given features
feature_list = ["search_engine_type", "product_type", "advertiser_type"]
for feature in feature_list:
print(df[feature].____)
print(df[feature].____)
# Define new features as counts
new_feature_list = ['device_id', 'site_id'] + feature_list
for new_feature in new_feature_list:
df[new_feature + '_count'] = df.____(
new_feature)['click'].____("count")
print(df.head(5))