Kom igångKom igång gratis

Hantera avvikande tecken (II)

I den förra övningen kunde du snabbt se vilka tecken som orsakade problem med hjälp av df.head(). I många fall är det inte lika uppenbart. Det finns ofta värden djupt inne i en kolumn som hindrar dig från att konvertera den till en numerisk typ – vilket behövs för att använda den i en modell eller för vidare feature engineering.

Ett sätt att hitta dessa värden är att tvinga kolumnen till önskad datatyp med pd.to_numeric(), konvertera problematiska värden till NaN och sedan filtrera DataFrame:n på de rader som innehåller NaN-värden.

Försök att konvertera kolumnen RawSalary till float – det kommer att misslyckas eftersom ett extra tecken nu finns i den. Hitta tecknet och ta bort det så att kolumnen kan konverteras till float.

Den här övningen är en del av kursen

Särdragshantering för maskininlärning i Python

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Attempt to convert the column to numeric values
numeric_vals = ____(so_survey_df['RawSalary'], errors='coerce')

# Find the indexes of missing values
idx = ____

# Print the relevant rows
print(so_survey_df['RawSalary']____)
Redigera och kör kod