हमारी data integrity कैसी है?
नए डेटा को banking DataFrame में मर्ज किया गया है, जिसमें यह विवरण है कि inv_amount कॉलम में किए गए निवेश चार अलग-अलग फ़ंड A, B, C और D में कैसे अलॉट किए गए हैं।
इसके अलावा, ग्राहकों की आयु और जन्मतिथि अब क्रमशः age और birth_date कॉलम में संग्रहीत हैं।
आप यह समझना चाहते हैं कि अलग-अलग आयु समूहों के ग्राहक कैसे निवेश करते हैं। लेकिन उससे पहले, आप यह पक्का करना चाहते हैं कि जिस डेटा का आप विश्लेषण कर रहे हैं, वह सही हो। आप inv_amount और age के मानों को अलग-अलग फ़ंड में किए गए निवेश और ग्राहकों की जन्मतिथियों के साथ क्रॉस-फ़ील्ड जाँच कर के यह सुनिश्चित करेंगे।
pandas और datetime क्रमशः pd और dt के रूप में इम्पोर्ट किए गए हैं।
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में डेटा क्लीनिंग
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Store fund columns to sum against
fund_columns = ['fund_A', 'fund_B', 'fund_C', 'fund_D']
# Find rows where fund_columns row sum == inv_amount
inv_equ = banking[____].____(____) == ____
# Store consistent and inconsistent data
consistent_inv = ____[____]
inconsistent_inv = ____[____]
# Store consistent and inconsistent data
print("Number of inconsistent investments: ", inconsistent_inv.shape[0])