분류용 데이터셋 생성하기
원하는 모든 기준 조합을 만족하는 실제 데이터셋을 찾기는 어렵고, 설령 수집하더라도 개인정보 보호 이슈가 있을 수 있습니다. 해결책으로, 데이터셋 생성기를 사용하면 현실 세계 데이터셋을 잘 근사한 데이터를 만들 수 있습니다.
이 연습 문제에서는 3개 클래스 분류 문제를 위한 대규모 데이터셋을 생성합니다. 산점도로 쉽게 시각화할 수 있도록, 커스텀 함수 plot_data_points()가 제공됩니다.
이 연습은 강의의 일부입니다
Python으로 배우는 데이터 프라이버시와 익명화
연습 안내
- 분류용 데이터셋을 생성하기 위해
sklearn.datasets에서 해당 함수를 가져오세요. 4개의 특성과 클래스당1개의 클러스터,3개의 클래스, 클래스 분리도2를 갖는5000개의 샘플을 생성하세요.- 생성된 데이터의 shape을 출력하세요.
- 결과 산점도를 확인하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Import the function for generating classification datasets
from sklearn.datasets import ____
# Generate 5000 samples with 4 features, 1 cluster per class, 3 classes, and class separation of 2
x, y = ____
# Inspect the generated data shape
print(____)
# Inspect the resulting data points in a 2 dimensional scatter plot
plot_data_points(x, y)