Čištění datasetu
Reálné datasety, jako je dataset o srdečních onemocněních, bývají často nepořádné – obsahují duplicitní nebo chybějící hodnoty. V tomto cvičení využiješ dovednosti z této kapitoly k vyčištění daného datasetu. Dataset je už načtený. Tvým úkolem je identifikovat a provést základní čistící operace na základě výsledků EDA: odstranit prázdné sloupce, smazat duplicitní řádky a provést imputaci sloupce restecg, který obsahuje měření elektrokardiogramu. Pandas je už naimportovaný jako pd a dataset o srdečních onemocněních je uložený jako pandas DataFrame s názvem heart_disease_df.
Toto cvičení je součástí kurzu
Strojové učení od začátku do konce
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Drop empty columns
heart_disease_column_dropped = heart_disease_df.____(____, ____)