우리 데이터의 무결성은 어떤가요?
새로운 데이터가 banking DataFrame에 병합되어 inv_amount 열의 투자 금액이 네 개의 서로 다른 펀드 A, B, C, D에 어떻게 배분되었는지에 대한 세부 정보를 담고 있어요.
또한 고객의 나이와 생일은 각각 age와 birth_date 열에 저장되어 있어요.
연령대별로 고객이 어떻게 투자하는지 파악하고 싶지만, 먼저 분석할 데이터가 올바른지 확인하려고 해요. 이를 위해 inv_amount와 age 값을 각각 펀드별 투자 금액과 고객의 생년월일과 교차 검증할 거예요.
pandas와 datetime은 각각 pd와 dt로 이미 임포트되어 있어요.
이 연습은 강의의 일부입니다
Python으로 데이터 정제하기
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Store fund columns to sum against
fund_columns = ['fund_A', 'fund_B', 'fund_C', 'fund_D']
# Find rows where fund_columns row sum == inv_amount
inv_equ = banking[____].____(____) == ____
# Store consistent and inconsistent data
consistent_inv = ____[____]
inconsistent_inv = ____[____]
# Store consistent and inconsistent data
print("Number of inconsistent investments: ", inconsistent_inv.shape[0])