ワンホットエンコーディングとダミー変数
カテゴリ変数をMachine Learningモデルで使うには、まず数量的に表現する必要があります。最も一般的な方法は、ワンホットエンコーディングを用いるか、ダミー変数を作成することです。この演習では、両方のエンコーディングを作成し、生成された列セットを比較します。前のレッスンと同じDataFrame so_survey_df を使い、Country 列に注目します。
この演習はコースの一部です
Python で学ぶ Machine Learning のための特徴量エンジニアリング
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Convert the Country column to a one hot encoded Data Frame
one_hot_encoded = ____(____, ____=['Country'], prefix='OH')
# Print the columns names
print(one_hot_encoded.columns)