Hantera avvikande tecken (II)
I den förra övningen kunde du snabbt se vilka tecken som orsakade problem med hjälp av df.head(). I många fall är det inte lika uppenbart. Det finns ofta värden djupt inne i en kolumn som hindrar dig från att konvertera den till en numerisk typ – vilket behövs för att använda den i en modell eller för vidare feature engineering.
Ett sätt att hitta dessa värden är att tvinga kolumnen till önskad datatyp med pd.to_numeric(), konvertera problematiska värden till NaN och sedan filtrera DataFrame:n på de rader som innehåller NaN-värden.
Försök att konvertera kolumnen RawSalary till float – det kommer att misslyckas eftersom ett extra tecken nu finns i den. Hitta tecknet och ta bort det så att kolumnen kan konverteras till float.
Den här övningen är en del av kursen
Särdragshantering för maskininlärning i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Attempt to convert the column to numeric values
numeric_vals = ____(so_survey_df['RawSalary'], errors='coerce')
# Find the indexes of missing values
idx = ____
# Print the relevant rows
print(so_survey_df['RawSalary']____)