НачатьНачать бесплатно

Генерация наборов данных для классификации

Найти реальный набор данных, который соответствовал бы всем нужным критериям, бывает непросто, а собранные данные нередко порождают проблемы с конфиденциальностью. Один из способов решить эту задачу — использовать генераторы наборов данных, которые дают хорошее приближение к реальным данным.

В этом упражнении вы создадите большой набор данных для задачи классификации с 3 классами. Для удобной визуализации результатов в виде точечного графика предусмотрена вспомогательная функция plot_data_points().

Это упражнение является частью курса

Конфиденциальность данных и анонимизация в Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте из sklearn.datasets функцию, предназначенную для генерации наборов данных для классификации.
  • Сгенерируйте 5000 образцов с 4 признаками, 1 кластером на класс, 3 классами и степенью разделимости классов 2.
  • Выведите форму сгенерированных данных.
  • Посмотрите на полученный точечный график.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import the function for generating classification datasets
from sklearn.datasets import ____

# Generate 5000 samples with 4 features, 1 cluster per class, 3 classes, and class separation of 2
x, y = ____

# Inspect the generated data shape
print(____)

# Inspect the resulting data points in a 2 dimensional scatter plot
plot_data_points(x, y)
Редактировать и запускать код