시작하기무료로 시작하기

일관된 합성 데이터셋

기업이 합성 데이터를 활용하는 대표적인 사례 중 하나는 인공지능과 Machine Learning 모델 학습입니다. 실제 데이터는 수집 비용이 많이 들거나 아예 구하기 어려울 때가 있습니다. 학습 데이터의 클래스 불균형이 심한 경우(예: 90% 이상이 한 클래스에 속함), 합성 데이터를 생성해 모델의 정확도를 높일 수 있어요.

이 연습 문제에서는 Faker를 사용해 모바일 앱 평점 데이터셋을 생성합니다.

초기 DataFrame은 ratings이며, ratinggender 두 열이 있습니다. Faker() 제너레이터는 fake_data로 이미 초기화되어 있어요.

이 연습은 강의의 일부입니다

Python으로 배우는 데이터 프라이버시와 익명화

강의 보기

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Generate a name according to the gender that will be unique in the dataset
ratings['name'] = [____ if x == "Female" 
                   else ____
                   for x in ratings['gender']] 
코드 편집 및 실행