Наборы данных с одинаковым вероятностным распределением
Цель синтетических данных — создать набор данных, максимально приближённый к реальному, не раскрывая при этом конфиденциальную персональную информацию. Например, команда Deloitte Consulting сгенерировала 80% обучающих данных для модели машинного обучения путём синтеза данных. Точность полученной модели оказалась сопоставимой с точностью модели, обученной на реальных данных.
В этом упражнении вы создадите синтетический набор данных с нуля с помощью Faker, следуя вероятностному распределению, загруженному как p.
Генератор Faker fake_data уже инициализирован, а numpy импортирован как np.
Это упражнение является частью курса
Конфиденциальность данных и анонимизация в Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Obtain or specify the probabilities
p = (0.46, 0.26, 0.16, 0.1, 0.02)
# Generate 5 random cities
cities = ____
# See the generated cities
print(cities)