クラスタリング用データセットの生成
合成データは完全に合法で、世界中のプライバシー関連の法律や規制要件を満たします。生データに代わる、プライバシーに配慮した有効な選択肢です。make_blobs() 関数を使うと、ガウス(正規)分布に従うデータ点を生成できます。
この演習では、15000 サンプルのデータセットを生成します。
numpy はすでに np としてインポート済みで、カスタム関数 plot_data_points() もこの演習用に用意されています。
この演習はコースの一部です
Pythonで学ぶデータプライバシーと匿名化
演習の手順
- クラスタリング用データセットを生成するために、
datasetsモジュールから該当する関数をインポートします。 15000サンプル、特徴量は2、中心は2、クラスタの標準偏差は3としてデータセットを生成します。- 生成されたデータの形状を出力します。
- 結果のデータ点を 2 次元の散布図で確認します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import the function from the datasets module for generating clustering datasets
from sklearn.datasets import ____
# Generate a dataset with 15000 rows, 2 features, 2 centers, and a cluster std of 3
x, labels = ____
# Print the shape of the resulting generated data
print(____)
# See the resulting data points in a 2 dimensional scatter plot
plot_data_points(x, labels)