시작하기무료로 시작하기

분류용 데이터셋 생성하기

원하는 모든 기준 조합을 만족하는 실제 데이터셋을 찾기는 어렵고, 설령 수집하더라도 개인정보 보호 이슈가 있을 수 있습니다. 해결책으로, 데이터셋 생성기를 사용하면 현실 세계 데이터셋을 잘 근사한 데이터를 만들 수 있습니다.

이 연습 문제에서는 3개 클래스 분류 문제를 위한 대규모 데이터셋을 생성합니다. 산점도로 쉽게 시각화할 수 있도록, 커스텀 함수 plot_data_points()가 제공됩니다.

이 연습은 강의의 일부입니다

Python으로 배우는 데이터 프라이버시와 익명화

강의 보기

연습 안내

  • 분류용 데이터셋을 생성하기 위해 sklearn.datasets에서 해당 함수를 가져오세요.
  • 4개의 특성과 클래스당 1개의 클러스터, 3개의 클래스, 클래스 분리도 2를 갖는 5000개의 샘플을 생성하세요.
  • 생성된 데이터의 shape을 출력하세요.
  • 결과 산점도를 확인하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Import the function for generating classification datasets
from sklearn.datasets import ____

# Generate 5000 samples with 4 features, 1 cluster per class, 3 classes, and class separation of 2
x, y = ____

# Inspect the generated data shape
print(____)

# Inspect the resulting data points in a 2 dimensional scatter plot
plot_data_points(x, y)
코드 편집 및 실행