新しい特徴量を作成する
特徴量エンジニアリングには、新しい特徴量の作成も含まれます。モデルはこうした特徴量に依存して予測精度を高めるため、新しい特徴量の作成は重要です。この演習では、データ上は整数として現れますが、実際にはカテゴリ値を表す3つの列の性質を確認します。これら3つの列は search_engine_type、product_type、advertiser_type です。これら3列に加えて、device_id と site_id に対してもカウント特徴量を作成します。カウント特徴量は、それぞれの列ごとにクリック数を表し、後で予測に利用します。
pandas モジュールはワークスペースで pd として利用可能で、サンプルの DataFrame は df として読み込まれています。
この演習はコースの一部です
PythonでMachine Learningを使ってCTRを予測する
演習の手順
feature_listに含まれる各特徴量について、値の総数とユニークな値の数を出力してください。.transform()を使って、new_feature_listの各特徴量ごとにクリック数を数え、新しい特徴量を作成してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Get counts of total and unique values for given features
feature_list = ["search_engine_type", "product_type", "advertiser_type"]
for feature in feature_list:
print(df[feature].____)
print(df[feature].____)
# Define new features as counts
new_feature_list = ['device_id', 'site_id'] + feature_list
for new_feature in new_feature_list:
df[new_feature + '_count'] = df.____(
new_feature)['click'].____("count")
print(df.head(5))