数据缩放
对于使用基于距离度量的 ML 算法,务必对数据进行缩放,否则不同量纲的特征会扭曲结果。K-means 使用欧氏距离来衡量到聚类质心的距离,因此在继续实现算法前,您需要先对数据进行缩放。我们先来完成这一步。
这里提供了上个练习中的数据框 df,已做过少量预处理,便于与 sklearn 一起使用。欺诈标签单独存放在 labels 中,您可以稍后用它来检查结果。已将 numpy 以 np 的名称导入。
本练习是课程的一部分
Python 中的欺诈检测
练习说明
- 导入
MinMaxScaler。 - 将数据框
df的值提取为 numpy 数组X,并确保类型为float。 - 将定义好的缩放器应用到
X上,得到缩放后的X_scaled,把所有特征强制到 0-1 范围。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import the scaler
from sklearn.preprocessing import ____
# Take the float values of df for X
X = df.values.astype(np.____)
# Define the scaler and apply to the data
scaler = ____()
X_scaled = scaler.____(X)