始める無料で始める

データの整合性は大丈夫?

新しいデータが banking DataFrame にマージされ、inv_amount 列にある投資額が、4つのファンド A、B、C、D にどのように配分されているかの詳細が追加されました。

さらに、顧客の年齢と誕生日が、それぞれ age 列と birth_date 列に保存されています。

年齢層ごとの投資傾向を理解したいと考えていますが、その前に分析対象のデータが正しいかを確認したいです。そこで、inv_amountage の値を、各ファンドへの投資額および顧客の誕生日と突き合わせて、クロスフィールド検証を行います。 pandasdatetime はそれぞれ pddt としてインポート済みです。

この演習はコースの一部です

Pythonで学ぶデータクリーニング

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Store fund columns to sum against
fund_columns = ['fund_A', 'fund_B', 'fund_C', 'fund_D']

# Find rows where fund_columns row sum == inv_amount
inv_equ = banking[____].____(____) == ____

# Store consistent and inconsistent data
consistent_inv = ____[____]
inconsistent_inv = ____[____]

# Store consistent and inconsistent data
print("Number of inconsistent investments: ", inconsistent_inv.shape[0])
コードを編集して実行