НачатьНачать бесплатно

Очистка набора данных

Реальные наборы данных, такие как набор данных о болезнях сердца, нередко содержат ошибки: дублирующиеся записи или пропущенные значения. В этом упражнении вы применяете навыки, полученные в данной главе, чтобы выполнить очистку этого набора данных. Набор данных уже загружен. Ваша задача — определить и провести основные операции очистки на основе результатов разведочного анализа данных: удалить пустые столбцы, убрать дублирующиеся строки и выполнить импутацию в столбце restecg, который содержит показатели электрокардиограммы. Библиотека Pandas уже импортирована как pd, а набор данных о болезнях сердца хранится в виде DataFrame под названием heart_disease_df.

Это упражнение является частью курса

Сквозное машинное обучение

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Drop empty columns
heart_disease_column_dropped = heart_disease_df.____(____, ____)
Редактировать и запускать код