ПочатиПочніть безкоштовно

Послідовний синтетичний набір даних

Один із сценаріїв, коли компанії використовують синтетичні дані, — це навчання моделей штучного інтелекту та машинного навчання. Реальні дані інколи дорого збирати або їх просто важко дістати. Коли тренувальні дані сильно незбалансовані (наприклад, понад 90% прикладів належать до одного класу), генерація синтетичних даних може допомогти побудувати точні моделі машинного навчання.

У цій вправі ви згенеруєте набір даних із рейтингами мобільного застосунку, використовуючи Faker.

Початковий датафрейм завантажено як ratings з двома стовпцями: rating та gender. Генератор Faker() вже ініціалізовано для вас як fake_data.

Ця вправа є частиною курсу

Конфіденційність даних і анонімізація в Python

Переглянути курс

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Generate a name according to the gender that will be unique in the dataset
ratings['name'] = [____ if x == "Female" 
                   else ____
                   for x in ratings['gender']] 
Редагувати та запускати код