ПочатиПочніть безкоштовно

Робота з зайвими символами (ІІ)

У попередній вправі ви швидко визначили за викликом df.head(), які символи спричиняють проблему. Проте часто це не так очевидно. Нерідко значення глибоко в межах стовпця заважають перетворити його на числовий тип, щоб використати у моделі чи для подальшого створення ознак.

Один зі способів знайти такі значення — примусово привести стовпець до потрібного типу даних за допомогою pd.to_numeric(), перетворивши проблемні значення на NaN, а потім відфільтрувати датафрейм лише за рядками, що містять значення NaN.

Спробуйте привести стовпець RawSalary до типу float — спроба не вдасться, адже в ньому є ще один символ. Знайдіть цей символ і приберіть його, щоб стовпець можна було перетворити на float.

Ця вправа є частиною курсу

Feature Engineering для машинного навчання в Python

Переглянути курс

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Attempt to convert the column to numeric values
numeric_vals = ____(so_survey_df['RawSalary'], errors='coerce')

# Find the indexes of missing values
idx = ____

# Print the relevant rows
print(so_survey_df['RawSalary']____)
Редагувати та запускати код