НачатьНачать бесплатно

Последовательный синтетический набор данных

Один из сценариев, в которых компании используют синтетические данные, — обучение моделей искусственного интеллекта и машинного обучения. Реальные данные порой дорого собирать или просто сложно получить. Когда обучающие данные сильно несбалансированы (например, более 90% наблюдений относятся к одному классу), генерация синтетических данных помогает строить точные модели машинного обучения.

В этом упражнении вы создадите синтетический набор данных с оценками мобильного приложения с помощью Faker.

Исходный DataFrame загружен как ratings и содержит два столбца: rating и gender. Генератор Faker() уже инициализирован для вас как fake_data.

Это упражнение является частью курса

Конфиденциальность данных и анонимизация в Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Generate a name according to the gender that will be unique in the dataset
ratings['name'] = [____ if x == "Female" 
                   else ____
                   for x in ratings['gender']] 
Редактировать и запускать код