1. Learn
  2. /
  3. Курси
  4. /
  5. Конфіденційність даних і анонімізація в Python

Connected

Вправа

Прогнозування рівня зарплат

У цій вправі ви використаєте набір даних про доходи з перепису, щоб передбачити, чи мають люди річний дохід понад $50K, чи ні.

Пам'ятайте, що під час створення приватної моделі слід указати межі як параметр, щоб уникнути додаткових втрат приватності та витоку інформації. Зазвичай межі можна обрати незалежно від даних — на основі предметної експертизи або за допомогою пошуку з DP-гістограмою.

Набір даних уже завантажено та розділено на X_train, y_train, X_test і y_test. Класифікатор доступний як dp_GaussianNB.

Інструкції

100 XP
  • Встановіть межі моделі, обчисливши значення min і max у тренувальних даних та додавши випадковий шум: відніміть і додайте випадкові числа в діапазоні від 5 до 40 для 5 стовпців наших даних.
  • Створіть класифікатор dp_GaussianNB з епсилоном 0.5 і раніше визначеними межами.
  • Навчіть модель на даних і подивіться оцінку (score).