分類用データセットの生成
望む条件の組み合わせをすべて満たす実データセットを見つけるのは難しく、たとえ収集できてもプライバシーの懸念が生じることがあります。そこで、データセットジェネレータを使って、実データに近い特性を持つデータを作成できます。
この演習では、3クラスの分類問題に対して大規模なデータセットを作成します。生成したデータを散布図で簡単に可視化できるよう、plot_data_points() というカスタム関数が用意されています。
この演習はコースの一部です
Pythonで学ぶデータプライバシーと匿名化
演習の手順
- 分類データセットを生成するために、
sklearn.datasetsから該当する関数をインポートします。 5000サンプル、4特徴量、クラスあたり1クラスタ、3クラス、クラス間分離2で生成します。- 生成したデータの形状を出力します。
- 結果の散布図を確認します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import the function for generating classification datasets
from sklearn.datasets import ____
# Generate 5000 samples with 4 features, 1 cluster per class, 3 classes, and class separation of 2
x, y = ____
# Inspect the generated data shape
print(____)
# Inspect the resulting data points in a 2 dimensional scatter plot
plot_data_points(x, y)