Začněte nyníZačněte zdarma

Čištění datasetu

Reálné datasety, jako je dataset o srdečních onemocněních, bývají často nepořádné – obsahují duplicitní nebo chybějící hodnoty. V tomto cvičení využiješ dovednosti z této kapitoly k vyčištění daného datasetu. Dataset je už načtený. Tvým úkolem je identifikovat a provést základní čistící operace na základě výsledků EDA: odstranit prázdné sloupce, smazat duplicitní řádky a provést imputaci sloupce restecg, který obsahuje měření elektrokardiogramu. Pandas je už naimportovaný jako pd a dataset o srdečních onemocněních je uložený jako pandas DataFrame s názvem heart_disease_df.

Toto cvičení je součástí kurzu

Strojové učení od začátku do konce

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Drop empty columns
heart_disease_column_dropped = heart_disease_df.____(____, ____)
Upravit a spustit kód