НачатьНачать бесплатно

Наборы данных с одинаковым вероятностным распределением

Цель синтетических данных — создать набор данных, максимально приближённый к реальному, не раскрывая при этом конфиденциальную персональную информацию. Например, команда Deloitte Consulting сгенерировала 80% обучающих данных для модели машинного обучения путём синтеза данных. Точность полученной модели оказалась сопоставимой с точностью модели, обученной на реальных данных.

В этом упражнении вы создадите синтетический набор данных с нуля с помощью Faker, следуя вероятностному распределению, загруженному как p.

Генератор Faker fake_data уже инициализирован, а numpy импортирован как np.

Это упражнение является частью курса

Конфиденциальность данных и анонимизация в Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Obtain or specify the probabilities
p = (0.46, 0.26, 0.16, 0.1, 0.02)

# Generate 5 random cities 
cities = ____

# See the generated cities
print(cities)
Редактировать и запускать код