ПочатиПочніть безкоштовно

Генерування наборів даних для кластеризації

Синтетичні дані є цілком легальними та відповідають вимогам законів і регламентів із приватності в усьому світі. Це коректна, орієнтована на приватність альтернатива „сирим" даним. Функцію make_blobs() можна використати, щоб згенерувати точки даних із ґаусовим (або нормальним) розподілом.

У цій вправі ви згенеруєте набір даних із 15000 зразків.

numpy уже імпортовано як np, а спеціальну функцію plot_data_points() знову надано для цієї вправи.

Ця вправа є частиною курсу

Конфіденційність даних і анонімізація в Python

Переглянути курс

Інструкції до вправи

  • Імпортуйте відповідну функцію з модуля datasets для генерування наборів даних для кластеризації.
  • Згенеруйте набір даних із 15000 зразків, з 2 ознаками, 2 центрами та стандартним відхиленням кластерів 3.
  • Виведіть розмірність (shape) згенерованих даних.
  • Перегляньте отримані точки даних на двовимірній точковій діаграмі.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import the function from the datasets module for generating clustering datasets
from sklearn.datasets import ____

# Generate a dataset with 15000 rows, 2 features, 2 centers, and a cluster std of 3
x, labels = ____

# Print the shape of the resulting generated data
print(____)

# See the resulting data points in a 2 dimensional scatter plot
plot_data_points(x, labels)
Редагувати та запускати код