Последовательный синтетический набор данных
Один из сценариев, в которых компании используют синтетические данные, — обучение моделей искусственного интеллекта и машинного обучения. Реальные данные порой дорого собирать или просто сложно получить. Когда обучающие данные сильно несбалансированы (например, более 90% наблюдений относятся к одному классу), генерация синтетических данных помогает строить точные модели машинного обучения.
В этом упражнении вы создадите синтетический набор данных с оценками мобильного приложения с помощью Faker.
Исходный DataFrame загружен как ratings и содержит два столбца: rating и gender. Генератор Faker() уже инициализирован для вас как fake_data.
Это упражнение является частью курса
Конфиденциальность данных и анонимизация в Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Generate a name according to the gender that will be unique in the dataset
ratings['name'] = [____ if x == "Female"
else ____
for x in ratings['gender']]