开始使用免费开始使用

生成用于分类的数据集

要找到一个同时满足多种条件组合的真实数据集并不容易,而且一旦采集,可能还会引发隐私问题。一个可行的解决方案是使用数据集生成器来近似真实世界的数据集。

在本练习中,您将为一个 3 类分类问题创建一个大型数据集。为便于将生成的数据可视化为散点图,我们已提供自定义函数 plot_data_points()

本练习是课程的一部分

Python 中的数据隐私与匿名化

查看课程

练习说明

  • sklearn.datasets 导入用于生成分类数据集的相应函数。
  • 生成 5000 个样本,包含 4 个特征、每个类别 1 个簇、共 3 个类别,类别间分离度为 2
  • 打印生成数据的形状。
  • 查看生成的散点图。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import the function for generating classification datasets
from sklearn.datasets import ____

# Generate 5000 samples with 4 features, 1 cluster per class, 3 classes, and class separation of 2
x, y = ____

# Inspect the generated data shape
print(____)

# Inspect the resulting data points in a 2 dimensional scatter plot
plot_data_points(x, y)
编辑并运行代码