ПочатиПочніть безкоштовно

Набори даних з однаковим імовірнісним розподілом

Мета синтетичних даних — створити настільки реалістичний набір даних, наскільки це можливо, не наражаючи на ризик важливу персональну інформацію. Наприклад, команда в Deloitte Consulting згенерувала 80% тренувальних даних для моделі машинного навчання шляхом синтезу даних. Точність отриманої моделі була подібною до моделі, навченої на реальних даних.

У цій вправі ви з нуля згенеруєте синтетичний набір даних за допомогою Faker, який відповідає імовірнісному розподілу, завантаженому як p.

Генератор Faker fake_data уже ініціалізовано, а numpy імпортовано як np.

Ця вправа є частиною курсу

Конфіденційність даних і анонімізація в Python

Переглянути курс

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Obtain or specify the probabilities
p = (0.46, 0.26, 0.16, 0.1, 0.02)

# Generate 5 random cities 
cities = ____

# See the generated cities
print(cities)
Редагувати та запускати код