Tính toàn vẹn dữ liệu của chúng ta ra sao?
Dữ liệu mới đã được gộp vào DataFrame banking, chứa chi tiết cách số tiền đầu tư trong cột inv_amount được phân bổ vào bốn quỹ A, B, C và D.
Ngoài ra, tuổi và ngày sinh của khách hàng hiện được lưu lần lượt trong các cột age và birth_date.
Bạn muốn hiểu cách khách hàng ở các nhóm tuổi khác nhau đầu tư. Tuy nhiên, trước tiên bạn muốn đảm bảo dữ liệu mình phân tích là chính xác. Bạn sẽ thực hiện điều này bằng cách kiểm tra chéo giá trị của inv_amount và age so với số tiền đầu tư vào các quỹ khác nhau và ngày sinh của khách hàng.
Cả pandas và datetime đều đã được import lần lượt là pd và dt.
Bài tập này là một phần của khóa học
Làm sạch dữ liệu với Python
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Store fund columns to sum against
fund_columns = ['fund_A', 'fund_B', 'fund_C', 'fund_D']
# Find rows where fund_columns row sum == inv_amount
inv_equ = banking[____].____(____) == ____
# Store consistent and inconsistent data
consistent_inv = ____[____]
inconsistent_inv = ____[____]
# Store consistent and inconsistent data
print("Number of inconsistent investments: ", inconsistent_inv.shape[0])