НачатьНачать бесплатно

Работа с лишними символами (II)

В предыдущем упражнении можно было быстро определить проблемные символы с помощью вызова df.head(). Однако на практике это не всегда так очевидно. Значения, которые мешают привести столбец к числовому типу, нередко скрыты глубоко в данных — а ведь без этого не обойтись ни при построении модели, ни при дальнейшем конструировании признаков.

Один из способов обнаружить такие значения — принудительно привести столбец к нужному типу с помощью pd.to_numeric(), заменив все проблемные значения на NaN, а затем отфильтровать строки DataFrame, содержащие эти NaN.

Попробуйте привести столбец RawSalary к типу float — это не удастся, поскольку в нём появился дополнительный посторонний символ. Найдите его и удалите, чтобы столбец можно было привести к типу float.

Это упражнение является частью курса

Конструирование признаков для машинного обучения в Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Attempt to convert the column to numeric values
numeric_vals = ____(so_survey_df['RawSalary'], errors='coerce')

# Find the indexes of missing values
idx = ____

# Print the relevant rows
print(so_survey_df['RawSalary']____)
Редактировать и запускать код