Побудуйте диференційно-приватний класифікатор
У цій вправі ви побудуєте та навчите приватну модель Gaussian Naive Bayes на наборі даних Penguin, щоб класифікувати, чи пінгвін є самцем або самицею.
K-анонімність погано працює з високовимірними або різнорідними наборами даних через суттєві теоретичні та емпіричні обмеження — „прокляття розмірності". Із ростом кількості ознак або вимірів обсяг даних, потрібний для коректного узагальнення, зростає експоненційно. Це одна з причин, чому диференційна приватність нині є переважною моделлю приватності. Параметр epsilon не залежить від будь-яких фонових знань і „обмежує" витік чутливої інформації.
DataFrame завантажено як penguin_df і розділено на X_train, y_train, X_test та y_test. Клас приватної моделі імпортовано як dp_GaussianNB.
Ця вправа є частиною курсу
Конфіденційність даних і анонімізація в Python
Інструкції до вправи
- Створіть класифікатор
dp_GaussianNBбез параметрів. - Навчіть попередньо створену модель на даних без додаткових параметрів.
- Обчисліть оцінку (score) приватної моделі на тестових даних.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Built the private classifier without parameters
dp_clf = ____
# Fit the model to the data
____(X_train, y_train)
# Print the accuracy score
print("The accuracy with default settings is ", ____(X_test, y_test))