特定の列のワンホットエンコーディング
近所の中古車販売店が、車の販売価格予測の手助けを求めています。used_cars データセット全体にワンホットエンコーディングを適用すると、新しいデータセットは1,200列以上になってしまいます。これでは、価格を予測するMachine Learningモデルの学習時に問題が起きるのではと心配です。そこで、よりシンプルな方法として、いくつかの列だけにワンホットエンコーディングを適用することにしました。
この演習はコースの一部です
Pythonでカテゴリカルデータを扱う
演習の手順
- 次の列に対してワンホットエンコーディングを行い、新しいデータセット
used_cars_simpleを作成してください(この順序で):"manufacturer_name"と"transmission"。 - 新しく作成されるすべての列の接頭辞を
"dummy"に設定し、追加された列を簡単にフィルタリングできるようにしてください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create one-hot encoding for just two columns
used_cars_simple = pd.____(
used_cars,
# Specify the columns from the instructions
____,
# Set the prefix
____
)
# Print the shape of the new dataset
print(used_cars_simple.shape)