始める無料で始める

新しい特徴量を作成する

特徴量エンジニアリングには、新しい特徴量の作成も含まれます。モデルはこうした特徴量に依存して予測精度を高めるため、新しい特徴量の作成は重要です。この演習では、データ上は整数として現れますが、実際にはカテゴリ値を表す3つの列の性質を確認します。これら3つの列は search_engine_typeproduct_typeadvertiser_type です。これら3列に加えて、device_idsite_id に対してもカウント特徴量を作成します。カウント特徴量は、それぞれの列ごとにクリック数を表し、後で予測に利用します。

pandas モジュールはワークスペースで pd として利用可能で、サンプルの DataFrame は df として読み込まれています。

この演習はコースの一部です

PythonでMachine Learningを使ってCTRを予測する

コースを見る

演習の手順

  • feature_list に含まれる各特徴量について、値の総数とユニークな値の数を出力してください。
  • .transform() を使って、new_feature_list の各特徴量ごとにクリック数を数え、新しい特徴量を作成してください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Get counts of total and unique values for given features
feature_list = ["search_engine_type", "product_type", "advertiser_type"]
for feature in feature_list:
	print(df[feature].____)
	print(df[feature].____)

# Define new features as counts
new_feature_list = ['device_id', 'site_id'] + feature_list
for new_feature in new_feature_list:
  df[new_feature + '_count'] = df.____(
    new_feature)['click'].____("count")
print(df.head(5))
コードを編集して実行