データの整合性は大丈夫?
新しいデータが banking DataFrame にマージされ、inv_amount 列にある投資額が、4つのファンド A、B、C、D にどのように配分されているかの詳細が追加されました。
さらに、顧客の年齢と誕生日が、それぞれ age 列と birth_date 列に保存されています。
年齢層ごとの投資傾向を理解したいと考えていますが、その前に分析対象のデータが正しいかを確認したいです。そこで、inv_amount と age の値を、各ファンドへの投資額および顧客の誕生日と突き合わせて、クロスフィールド検証を行います。
pandas と datetime はそれぞれ pd と dt としてインポート済みです。
この演習はコースの一部です
Pythonで学ぶデータクリーニング
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Store fund columns to sum against
fund_columns = ['fund_A', 'fund_B', 'fund_C', 'fund_D']
# Find rows where fund_columns row sum == inv_amount
inv_equ = banking[____].____(____) == ____
# Store consistent and inconsistent data
consistent_inv = ____[____]
inconsistent_inv = ____[____]
# Store consistent and inconsistent data
print("Number of inconsistent investments: ", inconsistent_inv.shape[0])