Генерування наборів даних для кластеризації
Синтетичні дані є цілком легальними та відповідають вимогам законів і регламентів із приватності в усьому світі. Це коректна, орієнтована на приватність альтернатива „сирим" даним. Функцію make_blobs() можна використати, щоб згенерувати точки даних із ґаусовим (або нормальним) розподілом.
У цій вправі ви згенеруєте набір даних із 15000 зразків.
numpy уже імпортовано як np, а спеціальну функцію plot_data_points() знову надано для цієї вправи.
Ця вправа є частиною курсу
Конфіденційність даних і анонімізація в Python
Інструкції до вправи
- Імпортуйте відповідну функцію з модуля
datasetsдля генерування наборів даних для кластеризації. - Згенеруйте набір даних із
15000зразків, з2ознаками,2центрами та стандартним відхиленням кластерів3. - Виведіть розмірність (shape) згенерованих даних.
- Перегляньте отримані точки даних на двовимірній точковій діаграмі.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import the function from the datasets module for generating clustering datasets
from sklearn.datasets import ____
# Generate a dataset with 15000 rows, 2 features, 2 centers, and a cluster std of 3
x, labels = ____
# Print the shape of the resulting generated data
print(____)
# See the resulting data points in a 2 dimensional scatter plot
plot_data_points(x, labels)