Набори даних з однаковим імовірнісним розподілом
Мета синтетичних даних — створити настільки реалістичний набір даних, наскільки це можливо, не наражаючи на ризик важливу персональну інформацію. Наприклад, команда в Deloitte Consulting згенерувала 80% тренувальних даних для моделі машинного навчання шляхом синтезу даних. Точність отриманої моделі була подібною до моделі, навченої на реальних даних.
У цій вправі ви з нуля згенеруєте синтетичний набір даних за допомогою Faker, який відповідає імовірнісному розподілу, завантаженому як p.
Генератор Faker fake_data уже ініціалізовано, а numpy імпортовано як np.
Ця вправа є частиною курсу
Конфіденційність даних і анонімізація в Python
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Obtain or specify the probabilities
p = (0.46, 0.26, 0.16, 0.1, 0.02)
# Generate 5 random cities
cities = ____
# See the generated cities
print(cities)