関連する特徴量の選択
この演習では、volunteer データセットの中で冗長な列を特定し、関連する特徴量だけを残すように特徴量選択を行い、該当する列からなる DataFrame を作成します。
例えば、コンソールで volunteer データセットを確認すると、locality、region、postalcode の3つの位置情報に関する特徴量が見つかります。これらは関連する情報を含むため、1つだけ残すのが理にかなっています。
コンソールで volunteer の特徴量を確認し、どの特徴量が冗長かを見つけてみてください。
この演習はコースの一部です
Pythonで学ぶMachine Learningの前処理
演習の手順
- 冗長な列名のリストを作成し、
to_drop変数に保存します:- 位置情報に関する特徴量のうち、残すのは
postalcodeのみとします。 - 特徴量エンジニアリングを施した特徴量も冗長となります。
- 位置情報に関する特徴量のうち、残すのは
- データセットから
to_dropリストにある列を削除します。 - 選択された列を確認するため、
volunteer_subsetの.head()を出力してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create a list of redundant column names to drop
to_drop = ["____", "____", "____", "____", "____"]
# Drop those columns from the dataset
volunteer_subset = ____.____(____, ____)
# Print out the head of volunteer_subset
print(____)