Генерация наборов данных для кластеризации
Синтетические данные полностью законны и отвечают всем требованиям законодательства о конфиденциальности по всему миру. Это полноценная, безопасная с точки зрения приватности альтернатива исходным данным. Функция make_blobs() позволяет генерировать точки данных с гауссовым (нормальным) распределением.
В этом упражнении вы создадите набор данных из 15000 наблюдений.
numpy уже импортирован как np, а пользовательская функция plot_data_points() снова доступна для работы.
Это упражнение является частью курса
Конфиденциальность данных и анонимизация в Python
Инструкции к упражнению
- Импортируйте соответствующую функцию из модуля
datasetsдля генерации наборов данных для кластеризации. - Сгенерируйте набор данных из
15000наблюдений с2признаками,2центрами и стандартным отклонением кластера равным3. - Выведите на экран форму полученного набора данных.
- Изучите полученные точки данных на двумерном точечном графике.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import the function from the datasets module for generating clustering datasets
from sklearn.datasets import ____
# Generate a dataset with 15000 rows, 2 features, 2 centers, and a cluster std of 3
x, labels = ____
# Print the shape of the resulting generated data
print(____)
# See the resulting data points in a 2 dimensional scatter plot
plot_data_points(x, labels)