Bộ dữ liệu tổng hợp nhất quán
Một kịch bản phổ biến mà các công ty sử dụng dữ liệu tổng hợp là để huấn luyện các mô hình trí tuệ nhân tạo và Machine Learning. Dữ liệu thực tế đôi khi tốn kém để thu thập hoặc đơn giản là khó có được. Khi dữ liệu huấn luyện bị mất cân bằng mạnh (ví dụ: hơn 90% quan sát thuộc về một lớp), việc tạo dữ liệu tổng hợp có thể giúp xây dựng các mô hình Machine Learning chính xác.
Trong bài tập này, bạn sẽ tạo một bộ dữ liệu đánh giá ứng dụng di động bằng Faker.
DataFrame ban đầu được nạp là ratings với hai cột: rating và gender. Trình tạo Faker() đã được khởi tạo sẵn cho bạn với tên fake_data.
Bài tập này là một phần của khóa học
Bảo mật dữ liệu và Ẩn danh trong Python
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Generate a name according to the gender that will be unique in the dataset
ratings['name'] = [____ if x == "Female"
else ____
for x in ratings['gender']]