Генерация наборов данных для классификации
Найти реальный набор данных, который соответствовал бы всем нужным критериям, бывает непросто, а собранные данные нередко порождают проблемы с конфиденциальностью. Один из способов решить эту задачу — использовать генераторы наборов данных, которые дают хорошее приближение к реальным данным.
В этом упражнении вы создадите большой набор данных для задачи классификации с 3 классами. Для удобной визуализации результатов в виде точечного графика предусмотрена вспомогательная функция plot_data_points().
Это упражнение является частью курса
Конфиденциальность данных и анонимизация в Python
Инструкции к упражнению
- Импортируйте из
sklearn.datasetsфункцию, предназначенную для генерации наборов данных для классификации. - Сгенерируйте
5000образцов с4признаками,1кластером на класс,3классами и степенью разделимости классов2. - Выведите форму сгенерированных данных.
- Посмотрите на полученный точечный график.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import the function for generating classification datasets
from sklearn.datasets import ____
# Generate 5000 samples with 4 features, 1 cluster per class, 3 classes, and class separation of 2
x, y = ____
# Inspect the generated data shape
print(____)
# Inspect the resulting data points in a 2 dimensional scatter plot
plot_data_points(x, y)