开始使用免费开始使用

数据缩放

对于使用基于距离度量的 ML 算法,务必对数据进行缩放,否则不同量纲的特征会扭曲结果。K-means 使用欧氏距离来衡量到聚类质心的距离,因此在继续实现算法前,您需要先对数据进行缩放。我们先来完成这一步。

这里提供了上个练习中的数据框 df,已做过少量预处理,便于与 sklearn 一起使用。欺诈标签单独存放在 labels 中,您可以稍后用它来检查结果。已将 numpynp 的名称导入。

本练习是课程的一部分

Python 中的欺诈检测

查看课程

练习说明

  • 导入 MinMaxScaler
  • 将数据框 df 的值提取为 numpy 数组 X,并确保类型为 float
  • 将定义好的缩放器应用到 X 上,得到缩放后的 X_scaled,把所有特征强制到 0-1 范围。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import the scaler
from sklearn.preprocessing import ____

# Take the float values of df for X
X = df.values.astype(np.____)

# Define the scaler and apply to the data
scaler = ____()
X_scaled = scaler.____(X)
编辑并运行代码