Jak je na tom integrita našich dat?
Do DataFrame banking byla přidána nová data s podrobnostmi o tom, jak jsou investice ve sloupci inv_amount rozděleny mezi čtyři různé fondy A, B, C a D.
Věk zákazníků a jejich data narození jsou teď uloženy ve sloupcích age a birth_date.
Chceš zjistit, jak zákazníci různých věkových skupin investují. Nejdřív si ale chceš ověřit, že data, se kterými pracuješ, jsou správná. Uděláš to tak, že pomocí křížové validace porovnáš hodnoty inv_amount a age s částkami investovanými do jednotlivých fondů a daty narození zákazníků.
Knihovna pandas je naimportovaná jako pd a datetime jako dt.
Toto cvičení je součástí kurzu
Čištění dat v Pythonu
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Store fund columns to sum against
fund_columns = ['fund_A', 'fund_B', 'fund_C', 'fund_D']
# Find rows where fund_columns row sum == inv_amount
inv_equ = banking[____].____(____) == ____
# Store consistent and inconsistent data
consistent_inv = ____[____]
inconsistent_inv = ____[____]
# Store consistent and inconsistent data
print("Number of inconsistent investments: ", inconsistent_inv.shape[0])