练习标准化
在未知分布上盲目使用 KNN 是有风险的。当各特征分布的量纲不一致时,它的表现会明显下降。未缩放的特征会扭曲距离计算,从而得到不合理的异常分数。
常用的对策是标准化,即对每个特征减去其均值,再除以其标准差。这样可使该特征的均值为 0、方差为 1。
请在已为您加载的 females 数据集上练习标准化。
本练习是课程的一部分
Python 中的异常检测
练习说明
- 创建一个
StandardScaler()实例并存为ss。 - 将特征与目标数组分别提取到
X和y。目标列是weightkg。 - 将
StandardScaler()拟合到 X 并同时转换。 - 重复上述过程,但要保留
XDataFrame 的列名。
交互式实操练习
通过完成这段示例代码来试试这个练习。
from sklearn.preprocessing import StandardScaler
# Initialize a StandardScaler
ss = ____
# Extract feature and target arrays
X = ____
y = ____
# Fit/transform X
X_transformed = ____
# Fit/transform X but preserve the column names
X.____ = ____