Создание классификатора с дифференциальной приватностью
В этом упражнении вы построите и обучите приватную модель гауссовского наивного байесовского классификатора на наборе данных Penguin, чтобы определить пол пингвина.
K-анонимность плохо справляется с многомерными и разнородными наборами данных из-за существенных теоретических и практических ограничений — так называемого «проклятия размерности». По мере роста числа признаков или измерений объём данных, необходимых для точного обобщения, увеличивается экспоненциально. Именно поэтому дифференциальная приватность стала предпочтительной моделью защиты данных. Параметр epsilon не зависит от каких-либо фоновых знаний и «ограничивает» утечку чувствительной информации.
Датафрейм загружен как penguin_df и разделён на X_train, y_train, X_test и y_test. Класс приватной модели импортирован как dp_GaussianNB.
Это упражнение является частью курса
Конфиденциальность данных и анонимизация в Python
Инструкции к упражнению
- Создайте классификатор
dp_GaussianNBбез параметров. - Обучите созданную модель на данных без указания каких-либо параметров.
- Вычислите оценку качества приватной модели на тестовых данных.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Built the private classifier without parameters
dp_clf = ____
# Fit the model to the data
____(X_train, y_train)
# Print the accuracy score
print("The accuracy with default settings is ", ____(X_test, y_test))