Bắt đầu ngayBắt đầu miễn phí

Tính toàn vẹn dữ liệu của chúng ta ra sao?

Dữ liệu mới đã được gộp vào DataFrame banking, chứa chi tiết cách số tiền đầu tư trong cột inv_amount được phân bổ vào bốn quỹ A, B, C và D.

Ngoài ra, tuổi và ngày sinh của khách hàng hiện được lưu lần lượt trong các cột agebirth_date.

Bạn muốn hiểu cách khách hàng ở các nhóm tuổi khác nhau đầu tư. Tuy nhiên, trước tiên bạn muốn đảm bảo dữ liệu mình phân tích là chính xác. Bạn sẽ thực hiện điều này bằng cách kiểm tra chéo giá trị của inv_amountage so với số tiền đầu tư vào các quỹ khác nhau và ngày sinh của khách hàng. Cả pandasdatetime đều đã được import lần lượt là pddt.

Bài tập này là một phần của khóa học

Làm sạch dữ liệu với Python

Xem khóa học

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Store fund columns to sum against
fund_columns = ['fund_A', 'fund_B', 'fund_C', 'fund_D']

# Find rows where fund_columns row sum == inv_amount
inv_equ = banking[____].____(____) == ____

# Store consistent and inconsistent data
consistent_inv = ____[____]
inconsistent_inv = ____[____]

# Store consistent and inconsistent data
print("Number of inconsistent investments: ", inconsistent_inv.shape[0])
Chỉnh sửa và Chạy Mã