生成用于分类的数据集
要找到一个同时满足多种条件组合的真实数据集并不容易,而且一旦采集,可能还会引发隐私问题。一个可行的解决方案是使用数据集生成器来近似真实世界的数据集。
在本练习中,您将为一个 3 类分类问题创建一个大型数据集。为便于将生成的数据可视化为散点图,我们已提供自定义函数 plot_data_points()。
本练习是课程的一部分
Python 中的数据隐私与匿名化
练习说明
- 从
sklearn.datasets导入用于生成分类数据集的相应函数。 - 生成
5000个样本,包含4个特征、每个类别1个簇、共3个类别,类别间分离度为2。 - 打印生成数据的形状。
- 查看生成的散点图。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import the function for generating classification datasets
from sklearn.datasets import ____
# Generate 5000 samples with 4 features, 1 cluster per class, 3 classes, and class separation of 2
x, y = ____
# Inspect the generated data shape
print(____)
# Inspect the resulting data points in a 2 dimensional scatter plot
plot_data_points(x, y)