处理杂散字符(II)
在上一个练习中,您通过调用 df.head() 就能很快看出是哪些字符导致了问题。而在很多情况下,这并不那么明显。某列深处常会有一些取值,阻止您把该列转换为数值类型,从而无法用于模型或后续特征工程。
一种查找这些取值的方法是:使用 pd.to_numeric() 强制将该列转换为所需的数据类型,把引发问题的值强制为 NaN,然后只筛选出包含 NaN 的那些行。
尝试将 RawSalary 列转换为浮点数,您会失败,因为其中又出现了额外的字符。找出该字符并将其移除,使该列可以成功转换为浮点数。
本练习是课程的一部分
Python 中的机器学习特征工程
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Attempt to convert the column to numeric values
numeric_vals = ____(so_survey_df['RawSalary'], errors='coerce')
# Find the indexes of missing values
idx = ____
# Print the relevant rows
print(so_survey_df['RawSalary']____)