クロス集計とピボットテーブル
金融データは、Excel のようなスプレッドシートでピボットテーブルとして見ることがよくあります。
クロス集計では、選んだ列を高い視点で確認でき、件数や平均などの集計も行えます。多くの信用リスクモデル、特にデフォルト確率では、person_emp_length や person_home_ownership のような列から調査を始めるのが一般的です。
データ全体で値の分布を把握し、可視化することができます。ここではまず、loan_status が持ち家の状態、ローングレード、収入に対するローン割合といった要因にどう影響されるかを確認しましょう。
データセット cr_loan はワークスペースに読み込まれています。
この演習はコースの一部です
Pythonで学ぶクレジットリスクモデリング
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create a cross table of the loan intent and loan status
print(pd.____(cr_loan[____], cr_loan[____], margins = True))