开始使用免费开始使用

练习标准化

在未知分布上盲目使用 KNN 是有风险的。当各特征分布的量纲不一致时,它的表现会明显下降。未缩放的特征会扭曲距离计算,从而得到不合理的异常分数。

常用的对策是标准化,即对每个特征减去其均值,再除以其标准差。这样可使该特征的均值为 0、方差为 1。

请在已为您加载的 females 数据集上练习标准化。

本练习是课程的一部分

Python 中的异常检测

查看课程

练习说明

  • 创建一个 StandardScaler() 实例并存为 ss
  • 将特征与目标数组分别提取到 Xy。目标列是 weightkg
  • StandardScaler() 拟合到 X 并同时转换。
  • 重复上述过程,但要保留 X DataFrame 的列名。

交互式实操练习

通过完成这段示例代码来试试这个练习。

from sklearn.preprocessing import StandardScaler

# Initialize a StandardScaler
ss = ____

# Extract feature and target arrays
X = ____ 
y = ____

# Fit/transform X
X_transformed = ____

# Fit/transform X but preserve the column names
X.____ = ____
编辑并运行代码