Začněte nyníZačněte zdarma

Jak je na tom integrita našich dat?

Do DataFrame banking byla přidána nová data s podrobnostmi o tom, jak jsou investice ve sloupci inv_amount rozděleny mezi čtyři různé fondy A, B, C a D.

Věk zákazníků a jejich data narození jsou teď uloženy ve sloupcích age a birth_date.

Chceš zjistit, jak zákazníci různých věkových skupin investují. Nejdřív si ale chceš ověřit, že data, se kterými pracuješ, jsou správná. Uděláš to tak, že pomocí křížové validace porovnáš hodnoty inv_amount a age s částkami investovanými do jednotlivých fondů a daty narození zákazníků. Knihovna pandas je naimportovaná jako pd a datetime jako dt.

Toto cvičení je součástí kurzu

Čištění dat v Pythonu

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Store fund columns to sum against
fund_columns = ['fund_A', 'fund_B', 'fund_C', 'fund_D']

# Find rows where fund_columns row sum == inv_amount
inv_equ = banking[____].____(____) == ____

# Store consistent and inconsistent data
consistent_inv = ____[____]
inconsistent_inv = ____[____]

# Store consistent and inconsistent data
print("Number of inconsistent investments: ", inconsistent_inv.shape[0])
Upravit a spustit kód