リサンプリング手法
前の演習では、クラス不均衡が混同行列の結果にどのような影響を与えるかを確認しました。この演習では、loan_data のようなクラス不均衡を含むデータセットに対して、別のリサンプリング方法を使うと結果がどう変わるかを確かめるため、リサンプリング手法を練習します。sklearn の resample() 関数を使うと、多数派クラスの行数に合わせることをアップサンプリング、少数派クラスの行数に合わせることをダウンサンプリングと呼びます。
loan_data のアップサンプリング版とダウンサンプリング版の両方を作成し、それぞれにロジスティック回帰を適用して性能を評価します。学習データとそのラベルは、deny が少数派クラス、approve が多数派クラスになるようにサブセット化されています。
予測用の学習/テスト分割済みオブジェクトは、演習で使用できるように X_test としてワークスペースに保存されています。
この演習はコースの一部です
Pythonで学ぶMachine Learning面接対策
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Upsample minority and combine with majority
loans_upsampled = ____(deny, replace=True, n_samples=len(____), random_state=123)
upsampled = pd.concat([approve, loans_upsampled])
# Downsample majority and combine with minority
loans_downsampled = ____(____, replace = False, n_samples = len(deny), random_state = 123)
downsampled = pd.concat([loans_downsampled, deny])