Praca z niechcianymi znakami (II)
W poprzednim ćwiczeniu wystarczyło jedno wywołanie df.head(), by od razu zobaczyć, które znaki powodują problem. W praktyce jednak tak oczywiste nie jest. Wartości utrudniające rzutowanie kolumny na typ liczbowy mogą być głęboko ukryte w danych – a bez tego nie można wykorzystać kolumny w modelu ani w dalszej inżynierii cech.
Jednym ze sposobów na znalezienie takich wartości jest wymuszenie konwersji kolumny do pożądanego typu za pomocą pd.to_numeric() z opcją zamiany problematycznych wartości na NaN, a następnie odfiltrowanie z DataFrame tylko wierszy zawierających te NaN-y.
Spróbuj rzutować kolumnę RawSalary na typ float – operacja zakończy się błędem, ponieważ w kolumnie pojawił się dodatkowy niechciany znak. Znajdź ten znak i usuń go, aby umożliwić rzutowanie kolumny na float.
To ćwiczenie jest częścią kursu
Inżynieria cech w uczeniu maszynowym w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Attempt to convert the column to numeric values
numeric_vals = ____(so_survey_df['RawSalary'], errors='coerce')
# Find the indexes of missing values
idx = ____
# Print the relevant rows
print(so_survey_df['RawSalary']____)