開始使用免費開始

處理雜散字元(II)

在上一個練習中,你只靠 df.head() 的輸出就能很快看出是哪一些字元造成問題。但很多時候並不會這麼明顯。常常是在欄位深處有某些值,讓你無法把該欄位轉成數值型別,因而無法用於模型或後續的特徵工程。

一個做法是強制把欄位轉成你想要的資料型別,使用 pd.to_numeric(),把造成問題的值強制轉為 NaN,然後再篩選出含有 NaN 的那些列。

嘗試把 RawSalary 欄位轉成 float,你會失敗,因為其中又多出了一個字元。找出並移除這個字元,讓該欄位可以順利轉成 float。

本練習屬於課程

Feature Engineering for Machine Learning in Python

檢視課程

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Attempt to convert the column to numeric values
numeric_vals = ____(so_survey_df['RawSalary'], errors='coerce')

# Find the indexes of missing values
idx = ____

# Print the relevant rows
print(so_survey_df['RawSalary']____)
編輯並執行程式碼