特徴量エンジニアリング
新しいローン申請者の集団について、返済不能(デフォルト)になる可能性があるかどうかを予測するタスクがあります。履歴データセットがあり、それを使って分類器を学習させたいと考えています。ただし、多くの特徴量が文字列形式であり、これは分類器にとって問題です。そこで、文字列の列を LabelEncoder() を使って数値にエンコードすることにしました。関数は sklearn の preprocessing サブモジュールから事前に読み込まれています。データセット credit も、データ型が文字列のすべての列名のリスト non_numeric_columns も事前に用意されています。
この演習はコースの一部です
Python で設計する Machine Learning ワークフロー
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Inspect the first few lines of your data using head()
credit.____