НачатьНачать бесплатно

Генерация наборов данных для кластеризации

Синтетические данные полностью законны и отвечают всем требованиям законодательства о конфиденциальности по всему миру. Это полноценная, безопасная с точки зрения приватности альтернатива исходным данным. Функция make_blobs() позволяет генерировать точки данных с гауссовым (нормальным) распределением.

В этом упражнении вы создадите набор данных из 15000 наблюдений.

numpy уже импортирован как np, а пользовательская функция plot_data_points() снова доступна для работы.

Это упражнение является частью курса

Конфиденциальность данных и анонимизация в Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте соответствующую функцию из модуля datasets для генерации наборов данных для кластеризации.
  • Сгенерируйте набор данных из 15000 наблюдений с 2 признаками, 2 центрами и стандартным отклонением кластера равным 3.
  • Выведите на экран форму полученного набора данных.
  • Изучите полученные точки данных на двумерном точечном графике.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import the function from the datasets module for generating clustering datasets
from sklearn.datasets import ____

# Generate a dataset with 15000 rows, 2 features, 2 centers, and a cluster std of 3
x, labels = ____

# Print the shape of the resulting generated data
print(____)

# See the resulting data points in a 2 dimensional scatter plot
plot_data_points(x, labels)
Редактировать и запускать код