Zacznij terazZacznij za darmo

Czyszczenie zbioru danych

Rzeczywiste zbiory danych, takie jak zbiór danych o chorobach serca, często są nieuporządkowane – zawierają zduplikowane lub brakujące wartości. W tym ćwiczeniu zastosujesz umiejętności zdobyte w tym rozdziale, aby wyczyścić zbiór danych o chorobach serca. Zbiór danych został już wczytany. Twoim zadaniem jest zidentyfikowanie i wykonanie ogólnych operacji czyszczenia na podstawie wyników EDA: usunięcie pustych kolumn, usunięcie zduplikowanych wierszy oraz imputacja kolumny restecg, która odnosi się do miary elektrokardiogramu. Biblioteka Pandas została zaimportowana jako pd, a zbiór danych o chorobach serca jest przechowywany jako DataFrame o nazwie heart_disease_df.

To ćwiczenie jest częścią kursu

End-to-End Machine Learning

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Drop empty columns
heart_disease_column_dropped = heart_disease_df.____(____, ____)
Edytuj i uruchom kod