始める無料で始める

特定の列のワンホットエンコーディング

近所の中古車販売店が、車の販売価格予測の手助けを求めています。used_cars データセット全体にワンホットエンコーディングを適用すると、新しいデータセットは1,200列以上になってしまいます。これでは、価格を予測するMachine Learningモデルの学習時に問題が起きるのではと心配です。そこで、よりシンプルな方法として、いくつかの列だけにワンホットエンコーディングを適用することにしました。

この演習はコースの一部です

Pythonでカテゴリカルデータを扱う

コースを見る

演習の手順

  • 次の列に対してワンホットエンコーディングを行い、新しいデータセット used_cars_simple を作成してください(この順序で):"manufacturer_name""transmission"
  • 新しく作成されるすべての列の接頭辞を "dummy" に設定し、追加された列を簡単にフィルタリングできるようにしてください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Create one-hot encoding for just two columns
used_cars_simple = pd.____(
  used_cars,
  # Specify the columns from the instructions
  ____,
  # Set the prefix
  ____
)

# Print the shape of the new dataset
print(used_cars_simple.shape)
コードを編集して実行