始める無料で始める

クレジットデータのワンホットエンコード

LogisticRegression() モデルに追加できるよう、非数値列を準備しましょう。

ワンホットエンコードで新しい列を作成したら、数値列と連結して、新しいデータフレームを作ります。これは以降のレッスンで、デフォルト確率の予測に使用します。

ワンホットエンコードは非数値列のみに適用してください。数値列に対して行うと、データが極端に横に広がってしまいます!

クレジットローンデータ cr_loan_clean はワークスペースに読み込まれています。

この演習はコースの一部です

Pythonで学ぶクレジットリスクモデリング

コースを見る

演習の手順

  • 数値列すべてのデータセットを cred_num、非数値列のデータセットを cred_str として作成します。
  • cred_str にワンホットエンコードを適用し、cred_str_onehot という新しいデータセットを作成します。
  • cred_num と新しいワンホットエンコード済みデータを結合し、結果を cr_loan_prep に保存します。
  • 新しいデータセットの列名を出力します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Create two data sets for numeric and non-numeric data
____ = ____.select_dtypes(exclude=['object'])
____ = ____.select_dtypes(include=['object'])

# One-hot encode the non-numeric columns
____ = pd.____(____)

# Union the one-hot encoded columns to the numeric ones
____ = pd.concat([____, ____], axis=1)

# Print the columns in the new data set
print(____.columns)
コードを編集して実行