Послідовний синтетичний набір даних
Один із сценаріїв, коли компанії використовують синтетичні дані, — це навчання моделей штучного інтелекту та машинного навчання. Реальні дані інколи дорого збирати або їх просто важко дістати. Коли тренувальні дані сильно незбалансовані (наприклад, понад 90% прикладів належать до одного класу), генерація синтетичних даних може допомогти побудувати точні моделі машинного навчання.
У цій вправі ви згенеруєте набір даних із рейтингами мобільного застосунку, використовуючи Faker.
Початковий датафрейм завантажено як ratings з двома стовпцями: rating та gender. Генератор Faker() вже ініціалізовано для вас як fake_data.
Ця вправа є частиною курсу
Конфіденційність даних і анонімізація в Python
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Generate a name according to the gender that will be unique in the dataset
ratings['name'] = [____ if x == "Female"
else ____
for x in ratings['gender']]