クレジットデータのワンホットエンコード
LogisticRegression() モデルに追加できるよう、非数値列を準備しましょう。
ワンホットエンコードで新しい列を作成したら、数値列と連結して、新しいデータフレームを作ります。これは以降のレッスンで、デフォルト確率の予測に使用します。
ワンホットエンコードは非数値列のみに適用してください。数値列に対して行うと、データが極端に横に広がってしまいます!
クレジットローンデータ cr_loan_clean はワークスペースに読み込まれています。
この演習はコースの一部です
Pythonで学ぶクレジットリスクモデリング
演習の手順
- 数値列すべてのデータセットを
cred_num、非数値列のデータセットをcred_strとして作成します。 cred_strにワンホットエンコードを適用し、cred_str_onehotという新しいデータセットを作成します。cred_numと新しいワンホットエンコード済みデータを結合し、結果をcr_loan_prepに保存します。- 新しいデータセットの列名を出力します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create two data sets for numeric and non-numeric data
____ = ____.select_dtypes(exclude=['object'])
____ = ____.select_dtypes(include=['object'])
# One-hot encode the non-numeric columns
____ = pd.____(____)
# Union the one-hot encoded columns to the numeric ones
____ = pd.concat([____, ____], axis=1)
# Print the columns in the new data set
print(____.columns)