Začněte nyníZačněte zdarma

Práce se záludnými znaky (II)

V předchozím cvičení bylo hned z výpisu df.head() vidět, které znaky způsobují problém. V praxi to ale bývá složitější. Hodnoty, které brání převodu sloupce na číselný typ – a tím i jeho použití v modelu nebo dalším feature engineeringu – mohou být schované hluboko uvnitř dat.

Jedním ze způsobů, jak je odhalit, je pokusit se sloupec převést na požadovaný datový typ pomocí pd.to_numeric() – přičemž všechny problematické hodnoty se nahradí NaN – a pak DataFrame filtrovat jen na řádky s hodnotami NaN.

Zkus převést sloupec RawSalary na typ float – operace selže, protože se v něm nyní skrývá ještě jeden nechtěný znak. Najdi ho a odstraň, aby bylo možné sloupec převést na float.

Toto cvičení je součástí kurzu

Feature Engineering for Machine Learning in Python

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Attempt to convert the column to numeric values
numeric_vals = ____(so_survey_df['RawSalary'], errors='coerce')

# Find the indexes of missing values
idx = ____

# Print the relevant rows
print(so_survey_df['RawSalary']____)
Upravit a spustit kód