二値特徴量のエンコード
データ型の置き換えは、前処理でとても重要です。この演習では、'Vmail_Plan' と 'Churn' の各特徴量について、'yes' を 1、'no' を 0 に割り当てます。
動画ではこれを行う2つの方法を紹介しました。1つは pandas、もう1つは scikit-learn を使う方法です。このような単純な作業には pandas を使うのがおすすめなので、ここでもその方法で進めます。一方、機械学習のパイプラインを構築したい場合(このコースの範囲外ですが)は、LabelEncoder() の利用も検討できます。データサイエンスでは、同じ目的を達成する方法が複数あるのが常であり、自分の用途に最も効果的な方法を選ぶことが大切です。
この演習はコースの一部です
マーケティングアナリティクス:Pythonで顧客解約を予測する
演習の手順
telcoの'Vmail_Plan'列で、'no'を0、'yes'を1に置き換えます。'Churn'列についても同様に置き換えます。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Replace 'no' with 0 and 'yes' with 1 in 'Vmail_Plan'
telco['Vmail_Plan'] = telco['____'].____(____)
# Replace 'no' with 0 and 'yes' with 1 in 'Churn'
telco['Churn'] = ____
# Print the results to verify
print(telco['Vmail_Plan'].head())
print(telco['Churn'].head())